
Nemotron-3-Diarization של NVIDIA: מודל פתוח לזיהוי דוברים
NVIDIA פרסמה את Nemotron-3-Diarization, מודל פתוח לזיהוי דוברים שמשיב לשאלה אחת לגבי כל הקלטה: מי דיבר ומתי. מודל אחד מכסה גם עיבוד לא־מקוון וגם פעולה בזרימה, עם תמיכה בעד שמונה דוברים.
NVIDIA פרסמה את Nemotron-3-Diarization, מודל פתוח לזיהוי דוברים שמשיב לשאלה אחת לגבי כל הקלטה: מי דיבר ומתי. לפי סקירה של כרטיס המודל ב-HackerNoon, הגרסה שוחררה ב-23 בספטמבר 2026, והעמוד מציג 4,282 הורדות. מודל אחד מכסה גם עיבוד לא־מקוון וגם פעולה בזרימה, עם תמיכה בעד שמונה דוברים.
המודל שייך למשפחת Sortformer ומסדר את ערוצי הפלט לפי הופעתו הראשונה של כל דובר: הקול הראשון שנשמע מקבל את הערוץ הראשון, וכך נפתרת בעיית החלפת הדוברים בלי להגדיר זהויות מראש. בזרימה, מטמון דוברים לפי סדר הגעה ותור FIFO מעבירים מידע על הדוברים והקשר של פריימים אחרונים בין הקטעים.
זרימה עם השהיה ניתנת להגדרה
התיעוד מפרט ארבע תצורות מומלצות. תצורת הלא־מקוון משתמשת בחוצץ קלט של 30.4 שניות ומעדיפה הקשר, ואילו תצורות הזרימה מציעות השהיית חוצץ של 1.04, 0.64 ו-0.32 שניות. אלה נתוני השהיית חוצץ בלבד: הם שווים ל-(CHUNK_LEN + RIGHT_CONTEXT) × 80 מ"ש ואינם כוללים זמן חישוב, העברה למכשיר ופענוח. מודל בודד מגיע ל-80 מ"ש, אך 0.32 שניות מסומנת כנקודת הפעולה המומלצת הנמוכה ביותר.
רזולוציית הפלט ניתנת להגדרה בכפולות של 10 מ"ש, ועיבוד בקטעים מבטל כל הגבלת אורך מקסימלית. המודל מחזיר מקטעים עם זמני התחלה וסיום ואינדקס דובר, ולצדם טנסורי הסתברות אופציונליים; במסלול Transformers הלא־מקוון הפלט כולל שמונה ערוצי דוברים, פריים אחד כל 10 מ"ש.
כלים, רישיון ומה שחסר בכרטיס
סביבת הפייתון המרכזית היא NVIDIA NeMo Speech, שבה המודל מיוצג במחלקה SortformerEncLabelModel, והוא פועל גם דרך המחלקה AutoModelForAudioFrameClassification של Transformers. מנוע C++ קליל בשם NeMo-Speech.cpp משלב תמלול עם זיהוי דוברים ומייצר תגי דובר ברמת המילה ב-JSON. תצורת NeMo המומלצת דורשת Python 3.12 ומעלה, Cython, PyTorch, libsndfile ו-ffmpeg.
המודל מופץ ברישיון openmdw-1.1, והכרטיס מציין שהוא מוכן לשימוש מסחרי ולא מסחרי. מספר הפרמטרים, מערך האימון, דרישות VRAM, המהירות וציוני DER אינם מפורטים, ולכן יש למדוד אותם על החומרה והאודיו שלכם. אינדקסי הדוברים משקפים סדר הופעה ולא שמות, והמודל מוגבל לשמונה דוברים בלבד.
למה זה חשוב
זיהוי דוברים הוא החצי החסר ברוב תהליכי תמלול הפגישות: ASR מתעד מה נאמר, והזיהוי מתעד מי אמר. מודל פתוח אחד שמכסה גם הקלטות ארכיון וגם פגישות בזמן אמת, עם תצורות השהיה מתועדות, מאפשר לצוותים לבנות אבות טיפוס של תמלולים עם שיוך דוברים בלי לחבר שני מודלים נפרדים. מדדי דיוק מפורסמים אין, ולכן ההחלטה עדיין צריכה להתבסס על מדידות בסביבה שלכם.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.