العودة
Nemotron-3-Diarization من NVIDIA: نموذج مفتوح لتحديد المتحدثين
SiTech AI Team2 წთ. საკითხავი

Nemotron-3-Diarization من NVIDIA: نموذج مفتوح لتحديد المتحدثين

أطلقت NVIDIA نموذج Nemotron-3-Diarization المفتوح الأوزان لتحديد المتحدثين، ليجيب عن سؤال واحد في أي تسجيل: من تحدث ومتى. النموذج نفسه يعمل دون اتصال وفي وضع البث، ويدعم حتى ثمانية متحدثين.

أطلقت NVIDIA نموذج Nemotron-3-Diarization، وهو نموذج مفتوح الأوزان لتحديد المتحدثين يجيب عن سؤال واحد في أي تسجيل صوتي: من تحدث ومتى. ووفق مراجعة لبطاقة النموذج نشرها موقع HackerNoon، صدر النموذج في 23 سبتمبر 2026، وتعرض الصفحة 4282 عملية تنزيل. ويغطي النموذج نفسه المعالجة دون اتصال والبث معًا، بدعم يصل إلى ثمانية متحدثين.

ينتمي النموذج إلى عائلة Sortformer ويرتّب قنوات الإخراج حسب ظهور كل متحدث للمرة الأولى: فالصوت الأول الذي يُسمع يأخذ القناة الأولى، وبذلك تُحل مشكلة تبدّل المتحدثين من دون تعريف هوياتهم مسبقًا. وأثناء البث تنقل ذاكرة المتحدثين بترتيب الوصول وطابور FIFO معلومات المتحدث وسياق الإطارات الأخيرة بين المقاطع.

بث بزمن استجابة قابل للضبط

توثق الوثائق أربع تهيئات موصى بها. تستخدم تهيئة وضع عدم الاتصال مخزنًا مؤقتًا للإدخال يبلغ 30.4 ثانية وتفضّل السياق، بينما توفر تهيئات البث 1.04 و0.64 و0.32 ثانية من زمن استجابة المخزن. وهذه أرقام المخزن وحده: فهي تساوي (CHUNK_LEN + RIGHT_CONTEXT) × 80 مللي ثانية ولا تشمل زمن الحساب ولا النقل إلى الجهاز ولا فك الترميز. ويصل نموذج واحد إلى 80 مللي ثانية، لكن الوثائق تحدد 0.32 ثانية كأدنى نقطة تشغيل موصى بها.

دقة الإخراج قابلة للضبط بمضاعفات 10 مللي ثانية، وتزيل المعالجة على مقاطع أي حد أقصى معلن للمدة. ويعيد النموذج مقاطع مع زمني البداية والنهاية ورقم المتحدث، واختياريًا موترات احتمالات؛ وفي مسار Transformers دون اتصال يحتوي الإخراج على ثماني قنوات للمتحدثين بمعدل إطار كل 10 مللي ثانية.

الأدوات والترخيص وأسئلة مفتوحة

الإطار الأساسي بلغة Python هو NVIDIA NeMo Speech، وفيه يظهر النموذج عبر الصنف SortformerEncLabelModel، كما يعمل عبر الصنف AutoModelForAudioFrameClassification من Transformers. ويمكن لبيئة تشغيل C++ خفيفة تُسمى NeMo-Speech.cpp أن تجمع النسخ النصي مع تحديد المتحدثين وتصدر وسوم المتحدثين على مستوى الكلمة بصيغة JSON. وتتطلب تهيئة NeMo الموصى بها إصدار Python 3.12 أو أحدث وCython وPyTorch ومكتبتي libsndfile وffmpeg.

يُوزَّع النموذج بترخيص openmdw-1.1، وتذكر البطاقة أنه جاهز للاستخدام التجاري وغير التجاري. ولا تُذكر أعداد المعاملات ولا بيانات التدريب ولا متطلبات VRAM ولا السرعة ولا نتائج DER، لذا يجب قياس هذه القيم على العتاد والصوت لديكم. وتعكس أرقام المتحدثين ترتيب ظهورهم لا أسماءهم، ويتوقف النموذج عند ثمانية متحدثين.

لماذا يهم هذا

تحديد المتحدثين هو النصف الناقص في معظم مسارات نسخ الاجتماعات: يوثّق نظام التعرف على الكلام ما قيل، ويوثّق تحديد المتحدثين من قاله. ونموذج واحد مفتوح يغطي التسجيلات المؤرشفة والاجتماعات المباشرة معًا، مع تهيئات موثقة لزمن الاستجابة، يتيح للفرق تجربة نصوص منسوبة إلى متحدثين من دون ربط نموذجين منفصلين. ولا توجد معايير دقة منشورة، لذا يبقى القرار معتمدًا على قياساتكم الخاصة.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.