Վերադառնալ
Google-ը ներկայացրել է Gemini 3.8 Flash TTS և Flash-Lite TTS մոդելները
SiTech AI Team2 წთ. საკითხავი

Google-ը ներկայացրել է Gemini 3.8 Flash TTS և Flash-Lite TTS մոդելները

Google-ը ներկայացրել է Gemini 3.8 Flash TTS և Flash-Lite TTS մոդելները. բնական լեզվի հուշումներով կարելի է ստեղծել նոր ձայներ, տող առ տող ղեկավարել երկխոսությունը և վերականգնել ձայնը 30 վայրկյանանոց նմուշից։

Google-ը 2026 թվականի սեպտեմբերի 23-ին ներկայացրել է տեքստը խոսքի վերածող երկու նոր մոդել՝ Gemini 3.8 Flash TTS և Gemini 3.8 Flash-Lite TTS: Ընկերության խոսքով՝ դրանք աուդիո սերնդացման իր ամենաարտահայտիչ մոդելներն են։

Երկուսն էլ հասանելի են Google AI Studio-ում, Gemini API-ում, Gemini Enterprise-ում, Gemini Notebook-ում և Google Vids-ում՝ շարունակելով Gemini Audio ընտանիքը։

Երկու մոդել՝ երկու նպատակ

Gemini 3.8 Flash TTS-ը նախատեսված է ստեղծագործական ռեժիսուրայի և կերպարների դիզայնի համար. ձայները ստեղծվում են զրոյից՝ բնական լեզվի հուշումներով, տող առ տող վերահսկելով դերասանական հուշումները, տեմպը և backchanneling-ը՝ խաղերի, աուդիոգրքերի, փոդքաստների և ինտերակտիվ մեդիայի համար։ Flash-Lite TTS-ը մեծ ծավալի և տնտեսող աշխատանքի համար է՝ կրկնօրինակում և արտահայտիչ ձայնային գործակալներ՝ տոնի, տեմպի և նրբերանգների ճշգրիտ կառավարմամբ։

Hume AI-ի Voice Design Benchmark-ի արդյունքները

Անհատական ձայներ և ձայնի վերարտադրում

Ձայնի դիզայնը 30 սկզբնական ձայնից ընդարձակվում է անսահմանափակ գրադարանի. հուշումները սահմանում են դեր, առոգանություն և այլ ձայնային բնութագրեր ավելի քան 100 լեզուներում ու բարբառներում, իսկ 2,000-ից ավելի պատրաստ ձայների կատալոգ կա։ Ձայնի վերարտադրումը 30 վայրկյանանոց նմուշից վերականգնում է ձայնային պրոֆիլ և պաշտպանված է համաձայնության ստուգմամբ ու SynthID ջրանիշով. AI Studio-ով վերարտադրումը հասանելի չէ Illinois-ում, Texas-ում, EEA-ում, Մեծ Բրիտանիայում, Շվեյցարիայում և Հնդկաստանում։

Ռեժիսուրա, երկար ձևաչափեր և բենչմարքեր

Երկու մոդելներն էլ թույլ են տալիս ղեկավարել ներկայացումը սցենարային նշումներով կամ ռեժիսորական ցուցումներով։ Google-ը առանձնացնում է երկար ձևաչափի սերնդացումը, որը ժամերով պահպանում է տեմբրն ու տեմպը նվազագույն drift-ով, մեկ սցենարից երկու խոսողի տեսարանը և ձայնային արձագանքները։ Hume AI-ի Voice Design Benchmark-ում Gemini 3.8 Flash TTS-ը առաջին տեղում է (71.4) և առաջատար՝ առոգանության մոդելավորմամբ (60.8). Hume-ի Overall Quality Index-ում Flash TTS-ը առաջինն է, Flash-Lite-ը՝ երկրորդը։ Voice Arena-ի կույր գնահատումներում մոդելը լավագույնների թվում է ճապոներենում և հինդիում։

Voice Arena-ի ցուցակի արդյունքները

Հասանելիություն

Flash TTS-ն արդեն հասանելի է ծրագրավորողներին Gemini API-ում և Google AI Studio-ում, բոլորին՝ Gemini Notebook-ում, իսկ Gemini Enterprise-ում API հասանելիությունը շուտով կլինի։ Flash-Lite TTS-ն աշխատում է Gemini API-ում, AI Studio-ում և Google Vids-ում։ AI Studio-ում նոր աուդիո հարթակ կա՝ ձայնի դիզայնի տարածք և երկու խոսողի սցենարի խմբագիր. մոդելները ինտեգրում են Agora-ն, LiveKit-ը, Pipecat-ը և Vercel-ը։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։