
NVIDIA تطلق Nemotron 3 Diarization للتمييز بين ثمانية متحدثين في الوقت الفعلي
أطلقت NVIDIA نموذج Nemotron 3 Diarization المفتوح بـ100 مليون معامل، والذي يحدد من تحدث ومتى. تصدّر النموذج نتائج Diarization-Bench من Voice Arena بمعدل خطأ 14.72% ويدعم حتى ثمانية متحدثين في الوقت الفعلي.
أطلقت NVIDIA نموذج Nemotron 3 Diarization المفتوح الأوزان بـ100 مليون معامل، والذي يحدد مَن تحدث ومتى في المحادثة. وفي النتائج الأولى لاختبار Diarization-Bench من Voice Arena، حل في المرتبة الأولى بين 12 نظاماً جرى تقييمها على 139 محادثة بالإنجليزية بإجمالي نحو 22 ساعة صوتية. وبلغ معدل خطأ الفصل بين المتحدثين (DER) 14.72% مقابل 19.3% للنظام التالي — تحسّن نسبي يقارب 24%. نُشر الوصف في مدونة Hugging Face في 23 سبتمبر.
يسجّل التعرف على الكلام ما قيل، بينما يحدد الفصل بين المتحدثين مَن قاله عبر تمييز الفترات الزمنية التي يكون فيها كل متحدث نشطاً، بما يشمل اللحظات التي يتحدث فيها شخصان في آنٍ واحد. وعند دمجه بمخرجات ASR ينتج نص منسوب إلى متحدثيه.
كيف يعمل النموذج
يستقبل Nemotron 3 Diarization صوتاً أحادي القناة بتردد 16 كيلوهرتز ويحوله إلى سمات طيف ميل بخطوة 10 مللي ثانية؛ وتُجمع السمات بمعامل ثمانية إلى إطارات من 80 مللي ثانية لمشفّر Transformer من 31 طبقة بتضمينات موضعية دورانية (RoPE). والمخرجات موتر بحجم [T, 8] من احتمالات نشاط المتحدثين: خطوات زمنية T مقابل ثماني قنوات، لذا يمكن أن تكون قناتان نشطتين في الإطار نفسه عند التداخل.
خلال البث المباشر تحافظ آليتا ذاكرة على ثبات التسميات: تحتفظ ذاكرة المتحدثين بترتيب الوصول (AOSC) بسياق المتحدثين من المقاطع السابقة، ويوفر طابور FIFO الإطارات الأخيرة. ويُرتب المتحدثون حسب وقت الظهور، فيصبح أول صوت جديد هو القناة الأولى. وبحسب NVIDIA، أدت إضافة صوت مرخّص من David AI إلى خفض معدل DER المركّب بمقدار 0.77 نقطة، من 11.19% إلى 10.42%.
الدقة وزمن الاستجابة
يجمع معدل DER ثلاثة أنواع من الأخطاء: الكلام المفقود، والإنذارات الكاذبة، وخلط المتحدثين. ويدعم النموذج أزمنة استجابة موصى بها لمخزن الإدخال تبلغ 30.4 و1.04 و0.64 و0.32 ثانية؛ وتعد 0.32 ثانية أدنى تشكيلة موصى بها. وعند 1.04 ثانية تحسّن معدل DER في شروط التقييم الثمانية جميعها: تراوحت الانخفاضات النسبية بين 9.0% و65.2%، وبلغ المتوسط غير الموزون 41.0%. والاستثناء الوحيد هو المجموعة الفرعية CALLHOME ذات المتحدثين: 5.98% للنموذج الجديد مقابل 5.68% للسابق.
ارتفعت الإنتاجية أيضاً: في تشكيلة 30.4 ثانية يبلغ النموذج 15,113× من معامل الزمن الحقيقي (RTFx) بحجم دفعة 32 مع torch.compile()، مقابل 2,619× للخط الأساسي، مع خفض معدل DER في DIHARD III من 19.09% إلى 12.73%. وفي تشكيلة 1.04 ثانية يبلغ الرقمان 865× و136×، ويهبط معدل DER من 19.60% إلى 13.18%.
الحدود والتوفر
يدعم النموذج ثمانية متحدثين كحد أقصى؛ وفي التسجيلات التي تضم مشاركين أكثر قد يُفقد الكلام أو يُنسب إلى قناة خاطئة، كما يزيد الضجيج والتسجيل بعيد المدى معدلات الخطأ. وتوصي NVIDIA باختبار المنظومة كاملة — الفصل بين المتحدثين مع ASR — على صوت تمثيلي قبل استخدام نسب الكلام في عمليات حساسة. ويصدر النموذج بموجب اتفاقية ترخيص OpenMDW الإصدار 1.1، ويعمل على وحدات رسوميات NVIDIA من فئات Ampere وHopper وBlackwell، وهو متاح في عرض تجريبي على Hugging Face Spaces.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.