
Google-მა Gemini 3.8 Flash TTS და Flash-Lite TTS წარადგინა
Google-მა 23 სექტემბერს Gemini 3.8 Flash TTS და Flash-Lite TTS წარადგინა: ბუნებრივი ენის პრომპტებით იქმნება ახალი ხმები, დიალოგს სტრიქონ-სტრიქონ მართავს რეჟისორი, ხოლო ხმის რეპლიკაცია 30-წამიანი ნიმუშიდან მუშაობს.
Google-მა 2026 წლის 23 სექტემბერს ორი ახალი text-to-speech მოდელი წარადგინა — Gemini 3.8 Flash TTS და Gemini 3.8 Flash-Lite TTS. კომპანიის ცნობით, ეს მისი ყველაზე გამომხატველი აუდიო-მოდელებია.
ორივე მოდელი ხელმისაწვდომია Google AI Studio-ში, Gemini API-ში, Gemini Enterprise-ში, Gemini Notebook-სა და Google Vids-ში და აგრძელებს Gemini Audio-ს ხაზს.
ორი მოდელი — ორი დანიშნულება
Gemini 3.8 Flash TTS შემოქმედებით რეჟისურასა და პერსონაჟების შექმნაზეა გამიზნული: ხმები ნულიდან იქმნება ბუნებრივი ენის პრომპტებით, სტრიქონ-სტრიქონ კონტროლით სათამაშო ინსტრუქციებზე, ტემპზე, დიალექტურ ცვლილებებსა და backchanneling-ზე — თამაშებისთვის, აუდიოწიგნების, პოდკასტებისა და ინტერაქტიული მედიისთვის. Flash-Lite TTS მაღალი მოცულობისა და დაბალი ხარჯის სამუშაოებისთვისაა — დუბლირება, გამომხატველი ხმოვანი აგენტები — ტონის, ტემპისა და ნიუანსის ზუსტი მართვით.
მორგებული ხმები და ხმის რეპლიკაცია
ხმის დიზაინი 30 საწყისი ხმიდან შეუზღუდავ ბიბლიოთეკამდე იზრდება: პრომპტებით დგინდება როლი, აქცენტი და სხვა ვოკალური მახასიათებლები 100-ზე მეტ ენასა და დიალექტში, ხოლო 2,000-ზე მეტი მზა ხმა რეგიონულ ვარიანტებსაც მოიცავს. ხმის რეპლიკაცია 30-წამიანი ნიმუშიდან აღადგენს ვოკალურ პროფილს და დაცულია თანხმობის შემოწმებითა და SynthID-ის ნიშნით; AI Studio-ში რეპლიკაცია არ მუშაობს Illinois-ში, Texas-ში, EEA-ში, დიდ ბრიტანეთში, შვეიცარიასა და ინდოეთში.
რეჟისურა, გრძელი ფორმატი და ბენჩმარკები
ორივე მოდელი რეჟისორს წარმოთქმის მართვას სცენარული ნიშნებითა თუ საკუთარი შენიშვნებით აძლევს. Google გამოყოფს გრძელი ფორმატის გენერაციას, რომელიც საათობით აუდიოშიც ინარჩუნებს ტემბრსა და ტემპს მინიმალური drift-ით, ორი მოსაუბრის ბუნებრივ სცენას ერთი სცენარიდან და ვოკალურ რეაქციებს, მაგალითად <laughs> და <sigh>. Hume AI-ის Voice Design Benchmark-ზე Gemini 3.8 Flash TTS პირველ ადგილზეა (71.4) და ლიდერობს აქცენტის მოდელირებაშიც (60.8); Hume-ის Overall Quality Index-ში Flash TTS პირველია, Flash-Lite — მეორე. Voice Arena-ს ბრმა შეფასებებში მოდელი ლიდერებს შორისაა იაპონურ, ბრაზილიურ პორტუგალიურ და ჰინდი ენებზე.
ხელმისაწვდომობა
Flash TTS უკვე ხელმისაწვდომია დეველოპერებისთვის Gemini API-სა და AI Studio-ში, ყველასთვის — Gemini Notebook-ში, ხოლო Gemini Enterprise-ში API წვდომა მალე გამოჩნდება. Flash-Lite TTS უკვე მუშაობს Gemini API-ში, AI Studio-სა და Google Vids-ში. AI Studio-ში ახალი აუდიო-სივრცე და ორი მოსაუბრის სცენარის რედაქტორია, მოდელებს კი ინტეგრირებენ Agora, LiveKit, Pipecat და Vercel.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.