
Microsoft випустила три нові AI-моделі для транскрипції в реальному часі та синтезу мовлення
Microsoft випустила три нові AI-моделі: MAI-Transcribe-2-Streaming для транскрипції в реальному часі та два модулі синтезу мовлення, MAI-Voice-2.1 і MAI-Voice-2.1-Flash. Модель транскрипції очолює рейтинг Artificial Analysis.
Microsoft 1 жовтня випустила три нові AI-моделі: модель транскрипції в реальному часі MAI-Transcribe-2-Streaming і дві моделі синтезу мовлення, MAI-Voice-2.1 та MAI-Voice-2.1-Flash.
Стримінгова транскрипція: 60 мов і рекордна точність
MAI-Transcribe-2-Streaming — перша стримінгова модель транскрипції компанії: вона безперервно приймає аудіопотік і повертає текст ще до того, як мовець закінчить говорити. Модель працює з 60 мовами, автоматично їх розпізнає, і, за даними Microsoft, посідає перше місце в рейтингу Artificial Analysis за точністю фінальних і часткових транскриптів. Згідно з лідербордом від 28 вересня, помилка фінального тексту (WER) становить 2,5%, першого часткового результату — 2,8%, а час до фінального транскрипту — 0,13 секунди.
Перші гіпотези (partials) модель повертає трохи більш ніж за 100 мілісекунд після отримання аудіо, а слова в транскрипті в більшості випадків з’являються за 320 мілісекунд. За оцінкою компанії, під час диктування та субтитрів слова з’являються вдвічі швидше, ніж у найближчого конкурента. Початкова ціна — 0,54 долара за годину аудіо, і вона діє до кінця року.
Дві моделі синтезу мовлення
MAI-Voice-2.1 — найпотужніша багатомовна модель синтезу мовлення компанії: вона працює з 23 мовами та 26 локалями, а один голос говорить усіма ними з рідною вимовою. Ціна — 22 долари за 1 мільйон символів.
MAI-Voice-2.1-Flash працює з тими самими мовами, але посилена для завдань із високим навантаженням і низькою затримкою: генерує до 45 секунд аудіо, а загальна затримка становить 150 мілісекунд. Вона на 55% швидша та приблизно на 60% дешевша за схожі моделі; ціна — 15 доларів за 1 мільйон символів.
Обидві здатні клонувати голос за кілька секунд аудіо будь-якою підтримуваною мовою; вбудовані механізми обмежують зловживання. У тесті Тюринга за участю 4000 слухачів 50,3% респондентів оцінили голос MAI-Voice як такий, що дорівнює людським записам або звучить людяніше.
Що це означає для ринку
Робота голосового агента йде циклом: слухання, розуміння, ухвалення рішення та відповідь. За словами Microsoft, пара MAI-Transcribe-2-Streaming і MAI-Voice-2.1-Flash економить час на обох кінцях цього циклу й залишає агенту більше простору для міркування. Компанія пропонує їх контакт-центрам, багатомовним асистентам і навчальним застосункам.
За аналізом RuntimeWire, нова модель у 5,4 раза дорожча за нестримінгову MAI-Transcribe-2, випущену у вересні (з 0,10 до 0,54 долара за годину), але це різні типи навантаження, а стара ціна була тимчасовою. Видання зазначає, що показники затримки описують можливості моделі, а не всієї системи.
Керівник Microsoft AI Мустафа Сулейман написав у X, що модель на 55% швидша та на 60% дешевша за ElevenLabs. Усі три моделі доступні в Microsoft Foundry, MAI Playground, Vercel і Azure Voice Live, голосові моделі також в OpenRouter; підтримку LiveKit додадуть незабаром; спільну роботу моделей у Playground демонструє Chatter.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.