العودة
Microsoft تطلق ثلاثة نماذج AI جديدة للنسخ الفوري وتوليف الصوت
SiTech AI Team2 دقيقة قراءة

Microsoft تطلق ثلاثة نماذج AI جديدة للنسخ الفوري وتوليف الصوت

أطلقت Microsoft ثلاثة نماذج AI جديدة: MAI-Transcribe-2-Streaming للنسخ في الوقت الفعلي ونموذجين لتوليف الصوت، MAI-Voice-2.1 وMAI-Voice-2.1-Flash. نموذج النسخ يحتل المركز الأول في تصنيف Artificial Analysis.

أطلقت Microsoft في 1 أكتوبر ثلاثة نماذج AI جديدة: نموذج النسخ في الوقت الفعلي MAI-Transcribe-2-Streaming ونموذجين لتوليف الكلام، MAI-Voice-2.1 وMAI-Voice-2.1-Flash.

النسخ المتدفق: 60 لغة ودقة قياسية

MAI-Transcribe-2-Streaming هو أول نموذج نسخ متدفق للشركة: يستقبل تدفق الصوت باستمرار ويعيد النص قبل أن ينهي المتحدث كلامه. يعمل النموذج بـ60 لغة، ويتعرف عليها تلقائيًا، وبحسب Microsoft يحتل المركز الأول في تصنيف Artificial Analysis من حيث دقة النصوص النهائية والجزئية. وفق لوحة الصدارة في 28 سبتمبر، بلغ خطأ النص النهائي (WER) 2.5%، وخطأ أول نتيجة جزئية 2.8%، والزمن حتى النص النهائي 0.13 ثانية.

يعيد النموذج الفرضيات الأولى (partials) بعد ما يزيد قليلًا عن 100 مللي ثانية من استقبال الصوت، وتظهر الكلمات في النص في معظم الحالات خلال 320 مللي ثانية. وبحسب تقدير الشركة، أثناء الإملاء والترجمات المرافقة تظهر الكلمات أسرع بمرتين مقارنة بأقرب منافس. السعر التمهيدي 0.54 دولار لكل ساعة صوت ويسري حتى نهاية العام.

نموذجان لتوليف الكلام

MAI-Voice-2.1 هو أقوى نموذج لتوليف الكلام متعدد اللغات لدى الشركة: يعمل بـ23 لغة و26 منطقة محلية، والصوت الواحد يتحدث في جميعها بلكنة أصلية. السعر 22 دولارًا لكل مليون حرف.

يعمل MAI-Voice-2.1-Flash باللغات نفسها، لكنه معزز لمهام الأحمال العالية وزمن الاستجابة المنخفض: يولّد حتى 45 ثانية من الصوت، وزمن الاستجابة الإجمالي 150 مللي ثانية. وهو أسرع بنسبة 55% وأرخص بنحو 60% من النماذج المشابهة؛ السعر 15 دولارًا لكل مليون حرف.

كلاهما قادر على استنساخ الصوت من بضع ثوانٍ من التسجيل، بأي لغة مدعومة؛ وتحد الآليات المدمجة من إساءة الاستخدام. في اختبار تورينغ بمشاركة 4000 مستمع، قيّم 50.3% من المشاركين صوت MAI-Voice بمستوى تسجيلات البشر أو أكثر شبهاً بالبشر.

ماذا يعني ذلك للسوق

تتبع عمل وكيل الصوت دورة: الاستماع، والفهم، واتخاذ القرار، والرد. وبحسب Microsoft، يوفر الثنائي MAI-Transcribe-2-Streaming وMAI-Voice-2.1-Flash الوقت عند طرفي هذه الدورة ويترك للوكيل مساحة أكبر للاستدلال. وتقدمهما الشركة لمراكز الاتصال والمساعدين متعددي اللغات وتطبيقات التعليم.

وفق تحليل RuntimeWire، النموذج الجديد أغلى بـ5.4 مرة من MAI-Transcribe-2 غير المتدفق الذي صدر في سبتمبر (من 0.10 إلى 0.54 دولار لكل ساعة)، لكن هذا نوع مختلف من الأحمال وكان السعر القديم مؤقتًا. ويشير المنشور إلى أن أرقام زمن الاستجابة تصف قدرات النموذج، لا النظام بأكمله.

كتب Mustafa Suleyman، رئيس Microsoft AI، على X أن النموذج أسرع بنسبة 55% وأرخص بنسبة 60% من ElevenLabs. النماذج الثلاثة متاحة على Microsoft Foundry وMAI Playground وVercel وAzure Voice Live، ونماذج الصوت أيضًا على OpenRouter؛ وسيضاف دعم LiveKit قريبًا؛ ويُظهر عرض Chatter التوضيحي في Playground عمل النماذج معًا.

المصادر: TipRanks · Techmeme

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.