Geri Dön
NVIDIA'nın Nemotron-3-Diarization modeli: açık ağırlıklı konuşmacı ayrıştırma
SiTech AI Team2 წთ. საკითხავი

NVIDIA'nın Nemotron-3-Diarization modeli: açık ağırlıklı konuşmacı ayrıştırma

NVIDIA, konuşmacı ayrıştırma modeli Nemotron-3-Diarization'ı açık ağırlıklarla yayımladı. Tek bir checkpoint hem çevrimdışı işlemeyi hem de akış modunu kapsıyor ve sekiz konuşmacıya kadar destek veriyor.

NVIDIA, bir kayıtta "kim ne zaman konuştu" sorusunu yanıtlayan açık ağırlıklı konuşmacı ayrıştırma modeli Nemotron-3-Diarization'ı yayımladı. HackerNoon'un incelemesine göre sürüm 23 Eylül 2026'da çıktı ve sayfada 4.282 indirme görünüyor. Tek bir checkpoint hem çevrimdışı işlemeyi hem akış modunu kapsıyor ve sekiz konuşmacıya kadar destek veriyor.

Model Sortformer ailesini izliyor ve çıkış kanallarını her konuşmacının ilk görünüşüne göre sıralıyor: ilk duyulan ses ilk kanalı alıyor, böylece kimlikleri önceden tanımlamaya gerek kalmadan konuşmacı permütasyonu sorunu çözülüyor. Akış sırasında Arrival-Order Speaker Cache ve FIFO kuyruğu, konuşmacı bilgisini ve son kare bağlamını parçalar arasında taşıyor.

Ayarlanabilir gecikmeyle akış

Belgeler dört önerilen yapılandırmayı açıklıyor. Çevrimdışı tarz kurulum 30,4 saniyelik giriş tamponu kullanıyor ve bağlama öncelik veriyor; akış ön ayarları ise 1,04, 0,64 ve 0,32 saniye giriş tamponu gecikmesi sunuyor. Bu değerler yalnızca tampon gecikmesi: (CHUNK_LEN + RIGHT_CONTEXT) × 80 ms'ye eşitler ve hesaplama süresiyle kod çözümünü içermiyorlar. Tek checkpoint 80 ms'ye iniyor, ancak önerilen en düşük nokta 0,32 saniye.

Çıkış çözünürlüğü 10 ms'nin katları olarak ayarlanabiliyor ve parçalı çıkarım maksimum süre sınırını kaldırıyor. Model, başlangıç ve bitiş zamanlarıyla konuşmacı indeksini içeren segmentler ve isteğe bağlı olasılık tensörleri döndürüyor; çevrimdışı Transformers yolunda çıktı sekiz konuşmacı kanalı ve her 10 ms'de bir kare içeriyor.

Araçlar, lisans ve açık sorular

Ana Python çerçevesi NVIDIA NeMo Speech; modeli SortformerEncLabelModel sınıfıyla sunuyor ve Transformers'ın AutoModelForAudioFrameClassification sınıfı üzerinden de çalışıyor. Hafif bir C++ çalışma zamanı olan NeMo-Speech.cpp, transkripsiyonu ayrıştırmayla birleştirip kelime düzeyinde konuşmacı etiketlerini JSON olarak veriyor. Önerilen NeMo kurulumu Python 3.12 veya üstünü, Cython'u, PyTorch'u, libsndfile'ı ve ffmpeg'i gerektiriyor.

Model openmdw-1.1 lisansıyla yayımlanıyor ve kart, ticari ve ticari olmayan kullanıma hazır olduğunu belirtiyor. Parametre sayısı, eğitim veri kümesi, VRAM gereksinimi, hız ve DER sonuçları belirtilmiyor; bu değerler hedef donanımda ölçülmeli. Konuşmacı indeksleri adları değil ortaya çıkış sırasını yansıtıyor ve model sekiz konuşmacıda duruyor.

Neden önemli

Konuşmacı ayrıştırma, toplantı transkripsiyonu iş akışlarının eksik yarısı: ASR ne söylendiğini, ayrıştırma ise kimin söylediğini kaydediyor. Arşiv kayıtlarını ve canlı toplantıları kapsayan, gecikme ön ayarları belgelenmiş tek açık checkpoint, ekiplerin iki modeli birleştirmeden konuşmacı etiketli transkriptleri denemesini sağlıyor. Yayımlanmış doğruluk ölçütleri yok, dolayısıyla karar yine kendi ölçümlerinize dayanıyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.