
Microsoft, gerçek zamanlı transkripsiyon ve konuşma sentezi için üç yeni AI modeli yayınladı
Microsoft üç yeni AI modeli yayınladı: gerçek zamanlı transkripsiyon için MAI-Transcribe-2-Streaming ile iki konuşma sentezi modeli MAI-Voice-2.1 ve MAI-Voice-2.1-Flash. Transkripsiyon modeli Artificial Analysis sıralamasında birinci.
Microsoft, 1 Ekim'de üç yeni AI modeli yayınladı: gerçek zamanlı transkripsiyon modeli MAI-Transcribe-2-Streaming ve iki konuşma sentezi modeli, MAI-Voice-2.1 ile MAI-Voice-2.1-Flash.
Akışlı transkripsiyon: 60 dil ve rekor doğruluk
MAI-Transcribe-2-Streaming şirketin ilk akışlı transkripsiyon modelidir: ses akışını kesintisiz alır ve konuşmacı konuşmasını bitirmeden önce metni döndürür. Model 60 dilde çalışır, onları otomatik algılar ve Microsoft'a göre nihai ile kısmi transkript doğruluğunda Artificial Analysis sıralamasında birincidir. 28 Eylül tarihli liderlik tablosuna göre nihai metnin hata oranı (WER) 2,5%, ilk kısmi sonucunki 2,8%, nihai transkripte kadar geçen süre ise 0,13 saniyedir.
Model ilk hipotezleri (partials) sesi aldıktan sonra 100 milisaniyeden biraz fazla sürede döndürür; kelimeler ise transkriptte çoğu durumda 320 milisaniyede görünür. Şirketin değerlendirmesine göre dikte ve altyazı sırasında kelimeler en yakın rakibe kıyasla iki kat daha hızlı görünür. Başlangıç fiyatı ses saati başına 0,54 dolar olup yıl sonuna kadar geçerlidir.
İki konuşma sentezi modeli
MAI-Voice-2.1 şirketin en güçlü çok dilli konuşma sentezi modelidir: 23 dil ve 26 yerel ayarla çalışır, tek bir ses ise hepsinde ana dili aksanıyla konuşur. Fiyatı 1 milyon karakter başına 22 dolardır.
MAI-Voice-2.1-Flash aynı dillerde çalışır, ancak yüksek yük ve düşük gecikme görevleri için güçlendirilmiştir: 45 saniyeye kadar ses üretir, toplam gecikme ise 150 milisaniyedir. Benzer modellere göre %55 daha hızlı ve yaklaşık %60 daha ucuzdur; fiyatı 1 milyon karakter başına 15 dolardır.
Her ikisi de birkaç saniyelik sese göre ses klonlamayı herhangi bir desteklenen dilde yapabilir; yerleşik mekanizmalar kötüye kullanımı sınırlar. 4000 dinleyicinin katıldığı Turing testinde yanıtlayanların 50,3%'ü MAI-Voice sesini insan kayıtları düzeyinde veya daha insani olarak değerlendirdi.
Bu pazar için ne anlama geliyor
Sesli ajanın çalışması bir döngü izler: dinleme, anlama, karar verme ve yanıt. Microsoft'a göre MAI-Transcribe-2-Streaming ile MAI-Voice-2.1-Flash ikilisi bu döngünün iki ucunda zaman kazandırır ve ajana akıl yürütme için daha fazla alan bırakır. Şirket bunları çağrı merkezlerine, çok dilli asistanlara ve eğitim uygulamalarına sunuyor.
RuntimeWire analizine göre yeni model, Eylül'de çıkan akışsız MAI-Transcribe-2'den 5,4 kat daha pahalıdır (saatte 0,10 dolardan 0,54 dolara), ancak bunlar farklı yük türleridir ve eski fiyat geçiciydi. Yayın, gecikme ölçümlerinin tüm sistemin değil modelin yeteneklerini tanımladığını belirtiyor.
Microsoft AI başkanı Mustafa Süleyman X'te modelin ElevenLabs'ten %55 daha hızlı ve %60 daha ucuz olduğunu yazdı. Üç modelin tümü Microsoft Foundry, MAI Playground, Vercel ve Azure Voice Live'da kullanılabilir; ses modelleri OpenRouter'da da; LiveKit desteği yakında eklenecek; modellerin birlikte çalışmasını Playground'daki Chatter demosu gösteriyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.