Назад
Нова модель ElevenLabs Eleven v4 робить штучні голоси виразнішими
SiTech AI Team2 წთ. საკითხავი

Нова модель ElevenLabs Eleven v4 робить штучні голоси виразнішими

ElevenLabs представила Eleven v4: модель точніше виконує режисерські підказки, зберігає голос упродовж тривалого проєкту та підтримує понад 90 мов. Версія Turbo видає перший звук за 150 мілісекунд.

ElevenLabs представила нову модель синтезу мовлення Eleven v4. За заявою компанії, вона точніше виконує режисерські підказки та зберігає однаковий голос упродовж тривалого проєкту. Призначена для голосових агентів у реальному часі Eleven v4 Turbo починає озвучувати розмову приблизно за 150 мілісекунд.

Більша послідовність

Eleven v3 вийшла близько року тому; такі ефекти, як сміх, шепіт і звук дверей, працювали вже тоді, але підказки виконувалися з меншою точністю. За словами компанії, v4 використовує нову архітектуру, яка аналізує тон, темп і контекст сценарію. Інструкції можна задавати тегами або звичайним реченням, а вимову імен і технічних термінів регулюють фонетичним записом. Контроль вимови тепер працює надійніше, а голос оповідача й персонажа звучить однаково впродовж усього проєкту навіть тоді, коли окрему фразу озвучують кілька разів.

Eleven v4-ის ინტერფეისი სცენარითა და ტეგებით

Для одного запиту модель приймає 10 000 символів, що становить приблизно 10 хвилин аудіо, а довші роботи поділяються на кілька сегментів. Кількість підтримуваних мов перевищує 90, тоді як v3 мала близько 70 мов. Клоновані голоси говорять іншими мовами з рідним акцентом, а Professional Voice Clone, який не працював у v3, знову доступний у v4. Instant Voice Clone потребує 10 секунд аудіо.

Turbo для агентів у реальному часі

ElevenLabs також випускає швидшу версію v4 для сервісних дзвінків і ігрових персонажів. За словами компанії, донедавна розробникам доводилося обирати між швидкістю та виразністю, а Turbo пропонує і те, й інше. У тестах компанії перший чутний звук лунає за 150 мілісекунд, Cartesia Sonic 3.6 потребує 262 мілісекунди, а OpenAI GPT-4o mini TTS — 814 мілісекунд. Turbo окремо оптимізовано для платформи ElevenAgents.

Тести та ціни

У рейтингу Provider Voice Arena від Artificial Analysis Eleven v4 випереджає Cartesia Sonic 3.6 і Google Gemini 3.8 Flash TTS. У тесті вимови модель отримала 91,7% проти 85,6% у v3. У сліпих тестах компанії приблизно три чверті слухачів оцінили v4 як виразнішу: перевага над Cartesia Sonic 3.6 і Inworld TTS-2 — 81%, над Gemini 3.8 Flash-Lite TTS — 72%, над Gemini 3.8 Flash TTS — 65%.

Стандартна ціна API для v4 — 80 доларів за мільйон символів, для Turbo — 40 доларів, а до 12 жовтня — 22 і 11 доларів. Користувачі тарифу Creator можуть протягом двох тижнів користуватися v4 в ElevenCreative без додаткової плати. Обидві моделі доступні в ElevenAgents, ElevenCreative та через API.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.