חזרה
NVIDIA Nemotron 3 Diarization מבדילה עד שמונה דוברים בזמן אמת
SiTech AI Team3 წთ. საკითხავი

NVIDIA Nemotron 3 Diarization מבדילה עד שמונה דוברים בזמן אמת

NVIDIA הציגה את Nemotron 3 Diarization — מודל בקוד פתוח עם 100 מיליון פרמטרים שמזהה מי דיבר ומתי. הוא דורג ראשון ב-Diarization-Bench של Voice Arena עם שיעור שגיאה של 14.72% ותומך בעד שמונה דוברים בזמן אמת.

NVIDIA הציגה את Nemotron 3 Diarization, מודל בקוד פתוח עם 100 מיליון פרמטרים שקובע מי דיבר ומתי בשיחה. בתוצאות הראשונות של Diarization-Bench מבית Voice Arena הוא דורג ראשון מבין 12 מערכות שנבחנו על 139 שיחות באנגלית באורך כולל של כ-22 שעות אודיו. שיעור שגיאת הדיאריזציה (DER) שלו עומד על 14.72%, לעומת 19.3% במערכת הבאה בתור — שיפור יחסי של כ-24%. תיאור המודל פורסם בבלוג של Hugging Face ב-23 בספטמבר.

זיהוי דיבור מתעד מה נאמר, ודיאריזציה קובעת מי אמר אותו: היא מסמנת את פרקי הזמן שבהם כל דובר פעיל, כולל רגעים שבהם אנשים מדברים זה על זה. בשילוב עם פלט ASR מתקבל תמלול עם ייחוס דוברים.

איך המודל עובד

Nemotron 3 Diarization מקבל אודיו חד-ערוצי בקצב 16 קילוהרץ וממיר אותו לתכונות מל-ספקטרוגרמה בצעד של 10 מ"ש; התכונות נאגדות פי שמונה לפריימים של 80 מ"ש עבור מקודד Transformer בן 31 שכבות עם הטמעות מיקום רוטציוניות (RoPE). הפלט הוא טנזור בגודל [T, 8] של הסתברויות פעילות: T צעדי זמן על פני שמונה ערוצים, כך שבעת חפיפה שני ערוצים יכולים להיות פעילים באותו פריים.

בזמן סטרימינג שני מנגנוני זיכרון שומרים על יציבות התוויות: מטמון הדוברים לפי סדר הגעה (AOSC) שומר הקשר על דוברים מקטעים קודמים, ותור FIFO מספק את הפריימים האחרונים. הדוברים מסודרים לפי זמן ההופעה, כך שהקול החדש הראשון הופך לערוץ הראשון. לפי NVIDIA, הוספת אודיו מורשה מ-David AI הפחיתה את ה-DER המשולב ב-0.77 נקודות, מ-11.19% ל-10.42%.

ביצועים והשהיה

ה-DER מאחד שלושה סוגי שגיאות: דיבור שהוחמץ, התראות שווא ובלבול בין דוברים. המודל תומך בהשהיות מומלצות של מאגר הקלט — 30.4, 1.04, 0.64 ו-0.32 שניות; 0.32 שניות היא הנמוכה ביותר. בהשהיה של 1.04 שניות ה-DER השתפר בכל שמונת תנאי ההערכה, עם שיפורים יחסיים מ-9.0% ב-CALLHOME-Part2 ועד 65.2% ב-NOTSOFAR1 MHM; הממוצע הלא משוקלל הוא 41.0%. היוצא מן הכלל היחיד הוא תת-הקבוצה CALLHOME עם שני דוברים: 5.98% למודל החדש לעומת 5.68% לקודם.

גם התפוקה עלתה: בקונפיגורציה של 30.4 שניות המודל מגיע ל-15,113× RTFx בגודל אצווה 32 עם torch.compile(), לעומת 2,619× בבסיס, ומוריד את ה-DER ב-DIHARD III מ-19.09% ל-12.73%. בהגדרה של 1.04 שניות הנתונים הם 865× ו-136×, וה-DER יורד מ-19.60% ל-13.18%.

מגבלות וזמינות

המודל תומך בשמונה דוברים לכל היותר; בהקלטות עם יותר משתתפים דיבור עלול להיעדר או להיות מיוחס לערוץ שגוי, ורעש ומיקרופון מרוחק מגבירים את השגיאות. NVIDIA ממליצה לבחון את כל הצינור — דיאריזציה עם ASR — על אודיו מייצג לפני שימוש בייחוס דוברים בתהליכים רגישים. המודל מופץ תחת OpenMDW License Agreement גרסה 1.1, פועל על GPU של NVIDIA מדגמי Ampere, Hopper או Blackwell, וזמין בהדגמה ב-Hugging Face Spaces.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.