
NVIDIA-nın Nemotron-3-Diarization modeli: açıq çəkili danışan bölgüsü
NVIDIA açıq çəkili danışan bölgüsü modeli Nemotron-3-Diarization-ı yayımlayıb. Tək bir checkpoint həm oflayn, həm də axın rejimində işləyir və səkkiz danışana qədər dəstək verir.
NVIDIA hər hansı yazıda «kim nə vaxt danışdı» sualına cavab verən açıq çəkili danışan bölgüsü modeli Nemotron-3-Diarization-ı yayımlayıb. HackerNoon-un icmalına görə, buraxılış 23 sentyabr 2026-da olub və səhifədə 4282 yükləmə görünür. Tək bir checkpoint həm oflayn emalı, həm də axın rejimini əhatə edir və səkkiz danışana qədər dəstək verir.
Model Sortformer ailəsinə əsaslanır və kanalları hər danışanın ilk görünməsinə görə sıralayır: ilk eşidilən səs ilk kanalı alır, bununla da danışanların yer dəyişməsi problemi identifikasiya təyin etmədən həll olunur. Axın zamanı Arrival-Order Speaker Cache və FIFO növbəsi danışan məlumatını və son kadr kontekstini hissələr arasında ötürür.
Tənzimlənən gecikmə ilə axın
Sənədlərdə dörd tövsiyə olunan konfiqurasiya təsvir edilir. Oflayn tipli quraşdırma 30,4 saniyəlik giriş buferi istifadə edir və kontekstə üstünlük verir; axın profilləri isə 1,04, 0,64 və 0,32 saniyə bufer gecikməsi təklif edir. Bu rəqəmlər yalnız bufer gecikməsidir: (CHUNK_LEN + RIGHT_CONTEXT) × 80 ms-ə bərabərdir və hesablama vaxtı ilə dekodlaşdırmanı əhatə etmir. Tək checkpoint 80 ms-ə çatır, lakin tövsiyə olunan ən aşağı nöqtə 0,32 saniyədir.
Çıxış ayırdetməsi 10 ms-in qatları ilə tənzimlənir və hissə-hissə emal maksimum müddət məhdudiyyətini aradan qaldırır. Model başlanğıc və bitmə vaxtları ilə danışan indeksini ehtiva edən seqmentlər, istəyə bağlı isə ehtimal tensorları qaytarır; oflayn Transformers çıxışı səkkiz danışan kanalı və hər 10 ms-də bir kadr verir.
Alətlər, lisenziya və açıq suallar
Əsas Python çərçivəsi NVIDIA NeMo Speech-dir; model SortformerEncLabelModel sinfi ilə təqdim olunur və Transformers-ın AutoModelForAudioFrameClassification sinfi dəstəklənir. Yüngül C++ mühiti NeMo-Speech.cpp transkripsiyanı bölgü ilə birləşdirib söz səviyyəsində danışan etiketlərini JSON kimi verir. Tövsiyə olunan NeMo mühiti Python 3.12 və ya daha yenisini, Cython-u, PyTorch-u, libsndfile-ı və ffmpeg-i tələb edir.
Model openmdw-1.1 lisenziyası ilə yayımlanır və kart onun kommersiya və qeyri-kommersiya istifadəsinə hazır olduğunu bildirir. Parametr sayı, təlim məlumat dəsti, VRAM tələbi, sürət və DER nəticələri göstərilmir, ona görə də bu dəyərləri öz avadanlığınızda və səsinizdə ölçmək lazımdır. Danışan indeksləri adları deyil, görünmə sırasını əks etdirir, model isə səkkiz danışanla məhdudlaşır.
Niyə vacibdir
Danışan bölgüsü iclas transkripsiyası iş axınının çatışmayan yarısıdır: ASR nə deyildiyini, bölgü isə kimin dediyini qeyd edir. Arxiv yazılarını və canlı iclasları eyni şəkildə əhatə edən, gecikmə profilləri sənədləşdirilmiş tək açıq model komandalara iki modeli birləşdirmədən danışana bağlı transkriptləri sınamaq imkanı verir. Dərc olunmuş dəqiqlik etalonları yoxdur, ona görə qərar öz ölçmələrinizə əsaslanır.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.