Վերադառնալ
NVIDIA-ի Nemotron-3-Diarization. բաց մոդել՝ ով երբ է խոսել
SiTech AI Team2 წთ. საკითხავი

NVIDIA-ի Nemotron-3-Diarization. բաց մոդել՝ ով երբ է խոսել

NVIDIA-ն հրապարակել է Nemotron-3-Diarization բաց կշիռներով մոդելը՝ խոսողների առանձնացման համար, որը պատասխանում է մեկ հարցի՝ ով և երբ է խոսել ձայնագրության մեջ։ Մեկ մոդելը աշխատում է և՛ անցանց, և՛ հոսքային ռեժիմում՝ մինչև ութ խոսողի աջակցությամբ։

NVIDIA-ն հրապարակել է Nemotron-3-Diarization բաց կշիռներով մոդելը, որը պատասխանում է մեկ հարցի՝ ով և երբ է խոսել ձայնագրության մեջ։ Համաձայն HackerNoon-ի՝ մոդելի քարտի վերանայման, թողարկումը եղել է 2026 թվականի սեպտեմբերի 23-ին, էջում գրանցված է 4282 ներբեռնում։ Մեկ մոդելը ծածկում է և՛ անցանց մշակումը, և՛ հոսքային աշխատանքը՝ մինչև ութ խոսողի աջակցությամբ։

Մոդելը պատկանում է Sortformer ընտանիքին և ալիքները դասավորում է ըստ խոսողի առաջին հայտնվելու. առաջին լսված ձայնը ստանում է առաջին ալիքը՝ լուծելով խոսողների փոխարկման խնդիրը առանց նախապես սահմանված ինքնությունների։ Հոսքի ընթացքում Arrival-Order Speaker Cache-ը և FIFO հերթը խոսողի տեղեկությունը և վերջին կադրերի կոնտեքստը տեղափոխում են հատվածների միջև։

Հոսք՝ կարգավորվող հետաձգմամբ

Դոկումենտացիան նկարագրում է չորս կարգավորում։ Անցանց տարբերակը օգտագործում է 30,4 վայրկյանի մուտքային բուֆեր և նախապատվությունը տալիս կոնտեքստին, իսկ հոսքային նախադրությունները առաջարկում են 1,04, 0,64 և 0,32 վայրկյան բուֆերի հետաձգում։ Դրանք միայն բուֆերի ցուցանիշներ են. հավասար են (CHUNK_LEN + RIGHT_CONTEXT) × 80 մվ-ի և չեն ներառում հաշվարկի ժամանակը ու ապակոդավորումը։ Մեկ մոդելը հասնում է 80 մվ-ի, սակայն խորհուրդ տրվող նվազագույնը 0,32 վայրկյանն է։

Ելքի լուծաչափությունը կարգավորվում է 10 մվ-ի բազմապատիկներով, իսկ հատվածային մշակումը վերացնում է տևողության առավելագույն սահմանը։ Մոդելը վերադարձնում է հատվածներ՝ սկզբի ու ավարտի ժամանակով և խոսողի ինդեքսով, ինչպես նաև հավանականության տենզորներ. անցանց ուղու ելքն ունի ութ ալիք և ամեն 10 մվ-ին մեկ կադր։

Գործիքներ, լիցենզիա և բաց հարցեր

Հիմնական Python շրջանակը NVIDIA NeMo Speech-ն է՝ SortformerEncLabelModel դասով, իսկ աշխատում է նաև Transformers-ի AutoModelForAudioFrameClassification դասի միջոցով։ Թեթև C++ ռանթայմը՝ NeMo-Speech.cpp-ն, միավորում է արտագրումն ու խոսողների առանձնացումը և բառային մակարդակով խոսողի պիտակները տալիս JSON-ով։ Առաջարկվող միջավայրը պահանջում է Python 3.12+, Cython, PyTorch, libsndfile և ffmpeg։

Մոդելը տարածվում է openmdw-1.1 լիցենզիայով, և քարտը նշում է, որ այն պատրաստ է կոմերցիոն ու ոչ կոմերցիոն օգտագործման։ Պարամետրերի քանակը, ուսուցման տվյալները, VRAM-ի պահանջը, արագությունը և DER-ի արդյունքները բացակայում են, ուստի դրանք պետք է չափել սեփական սարքավորումների վրա։ Խոսողի ինդեքսները ցույց են տալիս հայտնվելու հերթականությունը, ոչ անունները, իսկ մոդելը սահմանափակ է ութ խոսողով։

Ինչու է սա կարևոր

Խոսողների առանձնացումը հանդիպումների արտագրման գործընթացի պակասող կեսն է. ASR-ը գրանցում է, թե ինչ ասվեց, իսկ առանձնացումը՝ թե ով ասաց։ Մեկ բաց մոդել, որը ծածկում է արխիվային ձայնագրություններն ու ուղիղ հանդիպումները՝ հետաձգման փաստաթղթավորված ռեժիմներով, թիմերին հնարավորություն է տալիս փորձարկել խոսողին կապված արտագրություններ՝ առանց երկու մոդելներ միացնելու։ Հրապարակված ճշգրտության չափանիշներ չկան, ուստի որոշումը պետք է հիմնվի սեփական չափումների վրա։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։