
Google تطلق طرازي Gemini 3.8 Flash TTS وFlash-Lite TTS
أعلنت Google عن Gemini 3.8 Flash TTS وFlash-Lite TTS لتحويل النص إلى كلام، ويتيحان إنشاء أصوات من أوامر نصية وإخراج الحوار سطرًا بسطر واستنساخ الصوت من عيّنة من 30 ثانية.
أعلنت Google في 23 سبتمبر 2026 عن طرازين جديدين لتحويل النص إلى كلام: Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS، وتقول الشركة إنهما الأكثر تعبيرًا في توليد الصوت لديها.
يتاح الطارزان عبر Google AI Studio وGemini API وGemini Enterprise وGemini Notebook وGoogle Vids، ويواصلان عائلة Gemini Audio.
طارزان ومهمتان
صُمم Gemini 3.8 Flash TTS للإخراج الإبداعي وتصميم الشخصيات: تُنشأ الأصوات من الصفر بأوامر نصية طبيعية، مع تحكم سطرًا بسطر في توجيهات الأداء والإيقاع والتحولات اللهجية والتفاعلات الصوتية، للألعاب والكتب الصوتية والبودكاست والوسائط التفاعلية. أما Flash-Lite TTS فيستهدف الأعمال الكبيرة الموفرة: الدبلجة ووكلاء الصوت المعبّرين، بتحكم دقيق في النبرة والإيقاع والفروق الدقيقة.
أصوات مخصصة واستنساخ الصوت
يتوسع تصميم الصوت من 30 صوتًا أصليًا إلى مكتبة غير محدودة: تحدد الأوامر الدور واللهجة والخصائص الصوتية الأخرى في أكثر من 100 لغة ولهجة، ويضم الكتالوج أكثر من 2000 صوت جاهز بتنويعات إقليمية من الإسبانية المكسيكية إلى الإنجليزية الأسكتلندية. ويعيد استنساخ الصوت بناء ملف صوتي من عيّنة مدتها 30 ثانية، محميًا بالتحقق من الموافقة وعلامة SynthID؛ ولا يتوفر عبر AI Studio في إلينوي وتكساس والمنطقة الاقتصادية الأوروبية والمملكة المتحدة وسويسرا والهند.
الإخراج والمحتوى الطويل والمقارنات
يتيح الطارزان توجيه الأداء عبر إشارات السيناريو أو ملاحظات الإخراج المكتوبة. وتبرز Google توليد المحتوى الطويل الذي يحافظ على النبرة والإيقاع عبر ساعات من الصوت مع انحراف أدنى بين المتحدثين، ومشهدًا بمتحدثين من سيناريو واحد، وانفعالات صوتية مكتوبة مثل <laughs> و<sigh>. وفي Voice Design Benchmark من Hume AI حلّ Gemini 3.8 Flash TTS أولًا (71.4) وتصدر نمذجة اللهجات (60.8)؛ وفي Overall Quality Index من Hume جاء Flash TTS أولًا وFlash-Lite ثانيًا. وفي اختبارات التفضيل العمياء على Voice Arena جاء الطارزان بين المتصدرين في اليابانية والبرتغالية البرازيلية والهندية.
التوفر
يتاح Flash TTS الآن للمطورين في Gemini API وGoogle AI Studio، وللجميع في Gemini Notebook، وسيصل الوصول عبر API في Gemini Enterprise قريبًا. ويعمل Flash-Lite TTS في Gemini API وAI Studio وGoogle Vids. وتقدم ساحة الصوت الجديدة في AI Studio مساحة عمل لتصميم الأصوات ومحرر سيناريو بمتحدثين اثنين؛ وتدمج الطارزين Agora وLiveKit وPipecat وVercel، ومن الشركاء Figma وHeyGen وWondercraft.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.