
Nemotron-3-Diarization від NVIDIA: відкрита модель для «хто коли говорив»
NVIDIA опублікувала Nemotron-3-Diarization, відкриту модель діаризації мовців, яка відповідає на одне запитання про запис: хто і коли говорив. Одна модель охоплює і офлайн-обробку, і стрімінг, підтримуючи до восьми мовців.
NVIDIA опублікувала Nemotron-3-Diarization — модель діаризації мовців із відкритими вагами, яка відповідає на одне запитання про запис: хто і коли говорив. За оглядом модельної картки на HackerNoon, реліз відбувся 23 вересня 2026 року, а сторінка налічує 4282 завантаження. Одна модель охоплює і офлайн-обробку, і стрімінг, підтримуючи до восьми мовців.
Модель належить до родини Sortformer і впорядковує вихідні канали за першою появою кожного мовця: перший почутий голос отримує перший канал, що розв'язує проблему перестановки мовців без попередньо заданих ідентичностей. Під час стрімінгу Arrival-Order Speaker Cache і черга FIFO переносять інформацію про мовців та контекст останніх кадрів між фрагментами.
Стрімінг із налаштовуваною затримкою
Документація описує чотири рекомендовані конфігурації. Офлайн-варіант використовує 30,4-секундний вхідний буфер і віддає перевагу контексту, а стрімінгові пресети пропонують 1,04 с, 0,64 с і 0,32 с затримки буфера. Це показники лише буфера: вони дорівнюють (CHUNK_LEN + RIGHT_CONTEXT) × 80 мс і не враховують час обчислень, передавання на пристрій та декодування. Одна модель сягає 80 мс, але найнижчою рекомендованою точкою названо 0,32 с.
Роздільну здатність виходу можна налаштовувати кратно 10 мс, а обробка фрагментами знімає заявлене обмеження на максимальну тривалість. Модель повертає сегменти з часом початку й кінця та індексом мовця, а також, за бажанням, тензори ймовірностей; в офлайн-шляху Transformers на виході вісім каналів мовців, один кадр на кожні 10 мс.
Інструменти, ліцензія та відкриті питання
Основний Python-фреймворк — NVIDIA NeMo Speech, де модель представлена класом SortformerEncLabelModel; вона працює і через клас Transformers AutoModelForAudioFrameClassification. Легкий C++-рушій NeMo-Speech.cpp поєднує транскрипцію з діаризацією і видає послівні позначки мовців у JSON. Рекомендоване середовище NeMo потребує Python 3.12 або новішого, Cython, PyTorch, libsndfile і ffmpeg.
Модель поширюється за ліцензією openmdw-1.1, і картка зазначає готовність до комерційного та некомерційного використання. Кількість параметрів, навчальний набір даних, вимоги до VRAM, швидкість і результати DER не вказані, тож ці значення слід вимірювати на власному обладнанні та аудіо. Індекси мовців відображають порядок появи, а не імена, а сама модель обмежена вісьмома мовцями.
Чому це важливо
Діаризація — це відсутня половина більшості процесів транскрипції зустрічей: ASR фіксує, що сказано, а діаризація — хто це сказав. Одна відкрита модель, яка однаково покриває і архівні записи, і живі зустрічі, з документованими пресетами затримки, дає змогу прототипувати транскрипти з позначками мовців без зшивання двох окремих моделей. Опублікованих бенчмарків точності немає, тож рішення все одно має спиратися на власні вимірювання.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.