
Google משיקה את Gemini 3.8 Flash TTS ו-Flash-Lite TTS
Google הציגה את Gemini 3.8 Flash TTS ו-Flash-Lite TTS, שני מודלים שיוצרים קולות חדשים מהוראות בשפה טבעית, מביימים דיאלוג שורה-אחר-שורה ומשחזרים קול מדגימה של 30 שניות.
Google הציגה ב-23 בספטמבר 2026 שני מודלים חדשים להמרת טקסט לדיבור: Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS, שלדברי החברה הם המודלים ההבעתיים ביותר שלה ליצירת אודיו.
שניהם זמינים דרך Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook ו-Google Vids, וממשיכים את קו Gemini Audio.
שני מודלים, שני ייעודים
Gemini 3.8 Flash TTS מיועד לבימוי יצירתי ולעיצוב דמויות: קולות חדשים נוצרים מאפס בהוראות בשפה טבעית, עם שליטה שורה-אחר-שורה בהנחיות משחק, בקצב, במעברי דיאלקט וב-backchanneling — למשחקים, ספרי שמע, פודקאסטים ומדיה אינטראקטיבית. Flash-Lite TTS מכוון להיקפים גדולים ובעלות נמוכה: דיבוב וסוכני קול אקספרסיביים, עם שליטה מדויקת בטון, בקצב ובניואנסים.
קולות מותאמים אישית ושחזור קול
עיצוב הקול מתרחב מ-30 קולות מקוריים לספרייה בלתי מוגבלת: ההוראות קובעות תפקיד, מבטא ומאפיינים ווקאליים ביותר מ-100 שפות ודיאלקטים, וקטלוג של למעלה מ-2,000 קולות מוכנים כולל וריאציות אזוריות. שחזור קול בונה פרופיל ווקאלי מדגימה של 30 שניות, ומאובטח באימות הסכמה ובסימן המים SynthID; דרך AI Studio הוא אינו זמין באילינוי, טקסס, האזור הכלכלי האירופי, בריטניה, שווייץ והודו.
בימוי, תכנים ארוכים ובנצ'מרקים
שני המודלים מאפשרים לביים את ההגשה בסימני תסריט או בהערות בימוי כתובות. Google מדגישה יצירה ארוכה ששומרת על גוון וקצב לאורך שעות של אודיו עם סחיפת דובר מינימלית, סצנת שני דוברים מתסריט אחד, ופרצי קול כתובים כמו <laughs> ו-<sigh>. במדד Voice Design Benchmark של Hume AI הגיע Gemini 3.8 Flash TTS למקום הראשון (71.4) והוביל במידול מבטאים (60.8); במדד Overall Quality Index של Hume דורג Flash TTS ראשון ו-Flash-Lite שני. בהערכות עיוורות ב-Voice Arena דורגו המודלים בין המובילים ביפנית, פורטוגזית ברזילאית והינדי.
זמינות
Flash TTS זמין כעת למפתחים ב-Gemini API וב-Google AI Studio, ולכולם ב-Gemini Notebook, וגישה דרך API ב-Gemini Enterprise תגיע בקרוב. Flash-Lite TTS פעיל ב-Gemini API, ב-AI Studio וב-Google Vids. מגרש אודיו חדש ב-AI Studio מציע סביבת עבודה לעיצוב קול ועורך תסריט לשני דוברים; את המודלים משלבות Agora, LiveKit, Pipecat ו-Vercel.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.