
Google представила Gemini 3.8 Flash TTS і Flash-Lite TTS
Google представила Gemini 3.8 Flash TTS і Flash-Lite TTS — моделі, що створюють голоси з текстових підказок, керують репліками порядково та відтворюють голос із 30-секундного зразка.
Google 23 вересня 2026 року представила дві нові моделі синтезу мовлення: Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS, які компанія називає своїми найвиразнішими моделями генерації аудіо.
Обидві доступні через Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook і Google Vids та продовжують лінійку Gemini Audio.
Дві моделі — два призначення
Gemini 3.8 Flash TTS створена для творчої режисури та дизайну персонажів: голоси генеруються з нуля за допомогою підказок природною мовою, з порядковим контролем акторських інструкцій, темпу, діалектних змін і реакцій слухача — для ігор, аудіокниг, подкастів та інтерактивних медіа. Flash-Lite TTS розрахована на великі обсяги та економічність: дубляж і виразні голосові агенти з точним керуванням тоном, темпом і нюансами.
Власні голоси та реплікація голосу
Дизайн голосу масштабується від 30 початкових голосів до необмеженої бібліотеки: підказки задають роль, акцент та інші вокальні характеристики більш ніж у 100 мовах і діалектах, а каталог із понад 2000 готових голосів охоплює регіональні варіанти. Реплікація голосу відтворює вокальний профіль із 30-секундного зразка, захищена перевіркою згоди й водяним знаком SynthID; через AI Studio вона недоступна в Іллінойсі, Техасі, ЄЕЗ, Великій Британії, Швейцарії та Індії.
Режисура, довгі формати та бенчмарки
Обидві моделі дозволяють керувати подачею сценарними позначками або режисерськими зауваженнями. Google виокремлює генерацію довгих форматів, яка зберігає тембр і темп протягом годин аудіо з мінімальним дрейфом голосу, сцену з двома співрозмовниками з одного сценарію та вокальні реакції, як-от <laughs> і <sigh>. У Voice Design Benchmark від Hume AI Gemini 3.8 Flash TTS посіла перше місце (71.4) і лідирує в моделюванні акцентів (60.8); в Overall Quality Index від Hume Flash TTS перший, Flash-Lite — другий. У сліпих оцінках Voice Arena моделі увійшли до лідерів у японській, бразильській португальській та гінді.
Доступність
Flash TTS уже доступна розробникам у Gemini API та Google AI Studio, усім — у Gemini Notebook, а доступ через API в Gemini Enterprise з'явиться незабаром. Flash-Lite TTS працює в Gemini API, AI Studio та Google Vids. Новий аудіомайданчик в AI Studio пропонує робочий простір для дизайну голосу та редактор сценарію для двох співрозмовників; моделі інтегрують Agora, LiveKit, Pipecat і Vercel.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.