Назад
Alibaba випустила Qwen Audio 3.1: п’ять нових моделей і зниження цін на API до 95%
SiTech AI Team2 წთ. საკითხავი

Alibaba випустила Qwen Audio 3.1: п’ять нових моделей і зниження цін на API до 95%

Команда Qwen компанії Alibaba представила Qwen Audio 3.1 — родину з п’яти моделей для розпізнавання мови, синтезу голосу та голосової взаємодії в реальному часі. Ціни на TTS знижено приблизно на 70%, на realtime — на 85%, а на ASR — до 95%.

Команда Qwen компанії Alibaba випустила Qwen Audio 3.1 — родину з п’яти моделей для розпізнавання мови, синтезу голосу та голосової взаємодії в реальному часі. Разом із релізом компанія різко знизила ціни на свої аудіо-API: синтез мовлення подешевшав приблизно на 70%, модель реального часу — на 85%, а розпізнавання мови — аж до 95%.

Що вміють п’ять моделей

Базова модель розпізнавання мовлення (ASR) краще працює з багатомовними записами та діалектами й автоматично прибирає слова-заповнювачі та повтори — це важливо для транскрибування інтерв’ю, дзвінків і записів зустрічей без складної постобробки. ASR-Next додає розпізнавання кількох мовців із часовими позначками, а також визначає емоції, фонові звуки та шум техніки.

У синтезі модель TTS озвучує текст багатьма мовами з тим, що Qwen називає природним перенесенням голосу між мовами. Емоцію, швидкість і стиль задають звичайними текстовими підказками — наприклад: «Прочитай це різким, наказковим тоном, що вимагає поваги». TTS-Next поєднує мовну модель із дифузійним підходом і створює голос, звукові ефекти та фоновий звук за один прохід.

П’ята модель орієнтована на взаємодію в реальному часі: вона одночасно слухає й говорить та дозволяє миттєво перебити себе. За словами Qwen, коли вона розпізнає пригнічений настрій, то відповідає повільніше й з більшим співчуттям.

Зниження цін до 95%

Найгучніша частина анонсу — саме ціни. Розпізнавання мовлення, зазвичай найбільш об’ємне навантаження у голосових продуктах, подешевшало до 95%, модель реального часу — приблизно на 85%, а синтез — на 70%. Для команд, що обробляють великі обсяги транскрипцій або голосових агентів, це змінює економіку постійно активних аудіоконвеєрів.

Технічні деталі Qwen опублікувала у своєму блозі, а самі моделі доступні на Qwen Cloud під назвою Qwen Audio 3.1.

Чому це важливо

Голосові інтерфейси стали одним із найконкурентніших рівнів AI-стеку, і постачальники змагаються не лише якістю, а й ціною. Таке зниження у розпізнаванні та realtime-API підвищує планку для інших і робить постійно ввімкнені голосові функції — кол-центри, асистентів, інструменти доступності — дешевшими в експлуатації.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.