Назад
NVIDIA Nemotron 3 Diarization розрізняє до восьми мовців у реальному часі
SiTech AI Team3 წთ. საკითხავი

NVIDIA Nemotron 3 Diarization розрізняє до восьми мовців у реальному часі

NVIDIA випустила відкриту модель Nemotron 3 Diarization із 100 мільйонами параметрів. Вона очолила Diarization-Bench від Voice Arena з показником 14,72% і здатна розрізняти до восьми мовців у реальному часі.

NVIDIA представила Nemotron 3 Diarization — відкриту модель на 100 мільйонів параметрів, яка визначає, хто коли говорив у розмові. У перших результатах Diarization-Bench від Voice Arena вона посіла перше місце серед 12 систем, оцінених на 139 англомовних розмовах загальною тривалістю близько 22 годин. Показник діаризаційної помилки (DER) становить 14,72%, тоді як у наступної системи — 19,3%, тобто відносне покращення близько 24%. Опис опублікували в блозі Hugging Face 23 вересня.

Розпізнавання мовлення фіксує, що було сказано, а діаризація визначає, хто це сказав: вона позначає часові інтервали, протягом яких активний кожен мовець, зокрема ті, коли люди говорять одночасно. Поєднана з виходом ASR, вона дає транскрипт із зазначенням мовців.

Як працює модель

Nemotron 3 Diarization приймає одноканальне аудіо з частотою 16 кГц і перетворює його на ознаки мел-спектрограми з кроком 10 мс; ознаки укладаються у вісім разів у кадри по 80 мс для 31-шарового енкодера Transformer із ротаційними позиційними вкладеннями (RoPE). Вихід — тензор розміру [T, 8] з імовірностями активності мовців: T кроків часу на вісім каналів, тож під час перекриття два канали можуть бути активними в одному кадрі.

Під час потокової обробки стабільність позначок забезпечують два механізми пам'яті: Arrival-Order Speaker Cache (AOSC) зберігає контекст мовців із попередніх фрагментів, а черга FIFO надає останні кадри. Мовці впорядковуються за часом появи, тому перший новий голос стає першим каналом. За даними NVIDIA, додавання ліцензованого аудіо David AI зменшило складений DER на 0,77 пункту — з 11,19% до 10,42%.

Точність і затримка

DER поєднує три типи помилок: пропущене мовлення, хибні спрацювання та плутанину мовців. Модель підтримує рекомендовані затримки вхідного буфера 30,4, 1,04, 0,64 та 0,32 секунди; 0,32 секунди — найнижчий рекомендований режим. На затримці 1,04 секунди DER покращився в усіх восьми умовах: відносне зниження — від 9,0% на CALLHOME-Part2 до 65,2% на NOTSOFAR1 MHM, а незважене середнє — 41,0%. Єдиний виняток — підмножина CALLHOME із двома мовцями, де нова модель показує 5,98% проти 5,68% у попередньої.

Пропускна здатність теж зросла: у конфігурації на 30,4 секунди модель досягає 15 113× RTFx за розміру батчу 32 із torch.compile(), проти 2 619× у базової, знижуючи DER на DIHARD III з 19,09% до 12,73%. Для 1,04 секунди це 865× і 136×, а DER падає з 19,60% до 13,18%.

Обмеження й доступність

Модель підтримує щонайбільше вісім мовців: якщо учасників більше, мовлення може губитися або потрапляти до неправильного каналу, а шум і далекий мікрофон підвищують рівень помилок. NVIDIA радить перевіряти весь конвеєр — діаризацію разом з ASR — на репрезентативному аудіо, перш ніж застосовувати атрибуцію мовців у відповідальних процесах. Модель поширюється за OpenMDW License Agreement версії 1.1, працює на GPU NVIDIA Ampere, Hopper або Blackwell і доступна в демо Hugging Face Spaces.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.