Geri qayıt
NVIDIA Nemotron 3 Diarization real vaxtda səkkiz danışanı fərqləndirir
SiTech AI Team2 წთ. საკითხავი

NVIDIA Nemotron 3 Diarization real vaxtda səkkiz danışanı fərqləndirir

NVIDIA 100 milyon parametrli açıq çəkili Nemotron 3 Diarization modelini təqdim edib. Model Voice Arena-nın Diarization-Bench sınağında 14,72% xəta göstəricisi ilə birinci yeri tutub və real vaxtda səkkiz danışana qədər dəstəkləyir.

NVIDIA, söhbətdə kimin nə vaxt danışdığını müəyyən edən 100 milyon parametrli açıq çəkili Nemotron 3 Diarization modelini təqdim edib. Model Voice Arena-nın Diarization-Bench sınağının ilk nəticələrində 12 sistem arasında birinci yeri tutub; qiymətləndirmə təxminən 22 saat davam edən 139 ingilisdilli söhbəti əhatə edib. Diarizasiya xəta dərəcəsi (DER) 14,72% olub, növbəti sistemdə isə 19,3% — təxminən 24% nisbi yaxşılaşma. Təsvir 23 sentyabrda Hugging Face blogunda dərc olunub.

Nitq tanıma nə deyildiyini qeyd edir, diarizasiya isə kimin dediyini müəyyən edir: hər danışanın aktiv olduğu zaman aralıqlarını işarələyir, o cümlədən eyni anda danışan insanların anlarını. ASR çıxışı ilə birləşdikdə danışana aid edilmiş transkript alınır.

Model necə işləyir

Nemotron 3 Diarization 16 kHz təkkanallı audionu qəbul edib 10 ms addımlı Mel-spektroqram xüsusiyyətlərinə çevirir; xüsusiyyətlər səkkiz dəfə qatlanaraq 80 ms-lik çərçivələrə çevrilir və RoPE (rotary positional embeddings) istifadə edən 31 qatlı Transformer kodlaşdırıcısına verilir. Çıxış danışan aktivliyi ehtimallarından ibarət [T, 8] ölçülü tensordur: T zaman addımı və səkkiz kanal, beləliklə üst-üstə düşmədə eyni çərçivədə iki kanal aktiv ola bilər.

Axın rejimində etiketləri iki yaddaş mexanizmi sabit saxlayır: Arrival-Order Speaker Cache (AOSC) əvvəlki hissələrdəki danışan kontekstini saxlayır, FIFO növbəsi isə son çərçivələri təmin edir. Danışanlar görünmə vaxtına görə sıralanır; ilk yeni səs birinci kanal olur. NVIDIA-ya görə təlim məlumatlarına David AI-dan lisenziyalı audio əlavə etmək birləşmiş DER-i 0,77 bənd azaldıb: 11,19%-dən 10,42%-ə.

Dəqiqlik və gecikmə

DER üç növ xətanı birləşdirir: buraxılmış nitq, yanlış siqnal və danışanların qarışdırılması. Model giriş buferi üçün tövsiyə olunan 30,4, 1,04, 0,64 və 0,32 saniyəlik gecikmələri dəstəkləyir; 0,32 saniyə ən aşağı tövsiyə olunan konfiqurasiyadır. 1,04 saniyədə DER səkkiz şərtin hamısında yaxşılaşıb: nisbi azalma 9,0%-dən 65,2%-ə qədər dəyişir, çəkisiz ortalama isə 41,0%-dir. Yeganə istisna iki danışanlı CALLHOME alt çoxluğudur: yeni model 5,98%, əvvəlki baza isə 5,68% göstərir.

Məhsuldarlıq da artıb: 30,4 saniyəlik konfiqurasiyada model 32-lik toplu ölçüsündə torch.compile() ilə 15 113× RTFx-ə çatır (əvvəlki baza: 2 619×) və DIHARD III üzrə DER-i 19,09%-dən 12,73%-ə endirir. 1,04 saniyədə bu göstəricilər 865× və 136×-dir, DER isə 19,60%-dən 13,18%-ə düşür.

Məhdudiyyətlər və əlçatanlıq

Model maksimum səkkiz danışanı dəstəkləyir; daha çox iştirakçı olduqda nitq itə və ya yanlış kanala aid edilə bilər, səs-küy və uzaq mikrofonla yazı da xətaları artırır. NVIDIA, danışan aidiyyətini məsuliyyətli proseslərdə istifadə etməzdən əvvəl bütün sistemin — diarizasiya və ASR birlikdə — təmsiledici audio üzərində yoxlanmasını tövsiyə edir. Model OpenMDW License Agreement-ın 1.1 versiyası ilə yayımlanır, NVIDIA Ampere, Hopper və ya Blackwell GPU-larda işləyir və Hugging Face Spaces demosunda mövcuddur.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.