Geri Dön
NVIDIA Nemotron 3 Diarization, sekiz konuşmacıyı gerçek zamanlı ayırt ediyor
SiTech AI Team2 წთ. საკითხავი

NVIDIA Nemotron 3 Diarization, sekiz konuşmacıyı gerçek zamanlı ayırt ediyor

NVIDIA, 100 milyon parametreli açık ağırlıklı Nemotron 3 Diarization modelini tanıttı. Model, Voice Arena'nın Diarization-Bench testinde %14,72 hata oranıyla birinci oldu ve gerçek zamanlı olarak sekiz konuşmacıya kadar destekliyor.

NVIDIA, bir konuşmada kimin ne zaman konuştuğunu belirleyen 100 milyon parametreli açık ağırlıklı modeli Nemotron 3 Diarization'ı tanıttı. Model, Voice Arena'nın Diarization-Bench testinin ilk sonuçlarında 12 sistem arasında birinci oldu; değerlendirme, toplam yaklaşık 22 saatlik 139 İngilizce konuşmayı kapsıyordu. Diyarizasyon hata oranı (DER) %14,72 çıkarken ikinci sıradaki sistem %19,3'te kaldı — görece yaklaşık %24'lük bir iyileşme. Tanıtım 23 Eylül'de Hugging Face blogunda yayımlandı.

Konuşma tanıma ne söylendiğini kaydeder; diyarizasyon ise kimin söylediğini belirler ve her konuşmacının etkin olduğu zaman aralıklarını işaretler — insanların aynı anda konuştuğu anlar dâhil. ASR çıktısıyla birleştiğinde konuşmacı atamalı bir transkript ortaya çıkar.

Model nasıl çalışıyor

Nemotron 3 Diarization 16 kHz tek kanallı sesi alıp 10 ms adımlı Mel-spektrogram özniteliklerine dönüştürüyor; öznitelikler sekiz kat birleştirilip 80 ms'lik çerçevelere dönüşüyor ve RoPE (rotary positional embeddings) kullanan 31 katmanlı Transformer kodlayıcıya veriliyor. Çıktı, konuşmacı etkinliği olasılıklarından oluşan [T, 8] boyutunda bir tensör: T zaman adımı ve sekiz kanal, böylece üst üste konuşmada aynı çerçevede iki kanal etkin olabiliyor.

Akış sırasında etiketleri iki bellek mekanizması sabit tutuyor: Arrival-Order Speaker Cache (AOSC) önceki parçalardaki konuşmacı bağlamını saklıyor, FIFO kuyruğu ise son çerçeveleri sağlıyor. Konuşmacılar ortaya çıkış sırasına göre numaralanıyor; ilk yeni ses ilk kanal oluyor. NVIDIA'ya göre eğitim verisine David AI'dan lisanslı ses eklenmesi bileşik DER'i 0,77 puan azalttı: %11,19'dan %10,42'ye.

Gecikme ve başarım

DER üç hata türünü birleştirir: kaçırılan konuşma, yanlış alarm ve konuşmacı karışıklığı. Model, giriş tamponu için önerilen 30,4, 1,04, 0,64 ve 0,32 saniyelik gecikmeleri destekliyor; 0,32 saniye önerilen en düşük yapılandırma. 1,04 saniyede DER sekiz değerlendirme koşulunun tamamında iyileşti; görece düşüşler %9,0 ile %65,2 arasında ve sekiz değerin ağırlıksız ortalaması %41,0. Tek istisna iki konuşmacılı CALLHOME alt kümesi: yeni model %5,98 kaydediyor, önceki temel ise %5,68.

İşlem hacmi de arttı: 30,4 saniyelik yapılandırmada model, 32'lik toplu iş boyutunda torch.compile() ile 15.113× RTFx'e ulaşıyor (önceki temel: 2.619×) ve DIHARD III DER'ini %19,09'dan %12,73'e indiriyor. 1,04 saniyede bu değerler 865× ve 136×; DER ise %19,60'tan %13,18'e düşüyor.

Sınırlar ve erişim

Model en fazla sekiz konuşmacıyı destekliyor; daha kalabalık kayıtlarda konuşma kaybolabiliyor ya da yanlış kanala atanabiliyor, gürültü ve uzak mikrofon kaydı da hataları artırıyor. NVIDIA, konuşmacı atamasını kritik süreçlerde kullanmadan önce tüm hattın — diyarizasyon ve ASR'nin — temsili ses üzerinde denenmesini öneriyor. Model OpenMDW License Agreement sürüm 1.1 ile yayımlanıyor, NVIDIA Ampere, Hopper veya Blackwell GPU'larda çalışıyor ve Hugging Face Spaces demosunda deneyebiliyorsunuz.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.