Վերադառնալ
NVIDIA-ի Nemotron 3 Diarization-ը իրական ժամանակում տարբերում է ութ խոսողի
SiTech AI Team3 წთ. საკითხავი

NVIDIA-ի Nemotron 3 Diarization-ը իրական ժամանակում տարբերում է ութ խոսողի

NVIDIA-ն ներկայացրել է Nemotron 3 Diarization բաց մոդելը՝ 100 միլիոն պարամետրով։ Voice Arena-ի Diarization-Bench թեստում այն գրավել է առաջին տեղը՝ 14,72% սխալի ցուցանիշով, և իրական ժամանակում տարբերում է մինչև ութ խոսողի։

NVIDIA-ն ներկայացրել է Nemotron 3 Diarization-ը՝ բաց կշիռներով մոդել 100 միլիոն պարամետրով, որը զրույցում որոշում է, թե ով երբ է խոսել։ Voice Arena-ի Diarization-Bench թեստի առաջին արդյունքներում այն առաջին տեղն է զբաղեցրել 12 համակարգերի մեջ. գնահատումն ընդգրկել է 139 անգլերեն զրույց՝ ընդհանուր մոտ 22 ժամ աուդիո։ Դիարիզացիայի սխալի ցուցանիշը (DER) կազմել է 14,72%, հաջորդ համակարգինը՝ 19,3%․ դա մոտ 24% հարաբերական բարելավում է։ Նկարագրությունը հրապարակվել է Hugging Face-ի բլոգում սեպտեմբերի 23-ին։

Խոսքի ճանաչումը գրանցում է, թե ինչ է ասվել, իսկ դիարիզացիան որոշում է՝ ով ասաց. այն նշում է ժամանակահատվածները, որոնց ընթացքում յուրաքանչյուր խոսող ակտիվ է։ ASR-ի ելքի հետ միասին ստացվում է խոսողին վերագրված տեքստ։

Ինչպես է աշխատում մոդելը

Nemotron 3 Diarization-ը ընդունում է 16 կՀց միալիք աուդիո և վերածում Mel-սպեկտրոգրամի հատկանիշների՝ 10 մվ քայլով. հատկանիշները ութ անգամ դասավորվում են 80 մվ կադրերում և մշակվում RoPE (rotary positional embeddings) կիրառող 31 շերտով Transformer կոդավորիչով։ Ելքը [T, 8] չափի թենզոր է՝ խոսողների ակտիվության հավանականություններով. T ժամանակային քայլ ութ ալիքի վրա, ուստի համադրման դեպքում միևնույն կադրում երկու ալիք կարող է ակտիվ լինել։

Հոսքային ռեժիմում պիտակների կայունությունն ապահովում են հիշողության երկու մեխանիզմներ. Arrival-Order Speaker Cache (AOSC)-ը պահում է նախորդ հատվածների խոսողների համատեքստը, իսկ FIFO հերթը տրամադրում վերջին կադրերը։ Խոսողները դասավորվում են ըստ հայտնվելու պահի, ուստի առաջին նոր ձայնը դառնում է առաջին ալիքը։ NVIDIA-ի տվյալներով՝ David AI-ից լիցենզավորված աուդիոյի ավելացումը բաղադրյալ DER-ը նվազեցրել է 0,77 կետով՝ 11,19%-ից մինչև 10,42%։

Ճշգրտություն և ուշացում

DER-ը միավորում է երեք տեսակի սխալ. բաց թողնված խոսք, կեղծ արձանագրում և խոսողների շփոթում։ Մոդելը աջակցում է մուտքային բուֆերի չորս առաջարկվող ուշացման՝ 30,4, 1,04, 0,64 և 0,32 վայրկյան. 0,32 վայրկյանը ամենացածր առաջարկվողն է։ 1,04 վայրկյանի դեպքում DER-ը բարելավվել է գնահատման բոլոր ութ պայմաններում. հարաբերական նվազումը 9,0%-ից (CALLHOME-Part2) մինչև 65,2% է (NOTSOFAR1 MHM), իսկ չկշռված միջինը՝ 41,0%։ Միակ բացառությունը երկու խոսողով CALLHOME ենթաբազմությունն է՝ նոր մոդելը 5,98%, նախորդը՝ 5,68%։

Արտադրողականությունը նույնպես աճել է. 30,4 վայրկյանի կարգավորումով մոդելը հասնում է 15 113× RTFx-ի՝ batch size 32-ի և torch.compile()-ի դեպքում, նախորդի 2 619×-ի դիմաց, և DIHARD III-ի DER-ը իջեցնում է 19,09%-ից 12,73%։ 1,04 վայրկյանի դեպքում ցուցանիշները 865× և 136× են, իսկ DER-ը՝ 19,60%-ից 13,18%։

Սահմանափակումներ և հասանելիություն

Մոդելը աջակցում է առավելագույնը ութ խոսողի. ավելի շատ մասնակիցների դեպքում խոսքը կարող է կորչել կամ սխալ ալիքին վերագրվել։ NVIDIA-ն խորհուրդ է տալիս ամբողջ համակարգը՝ դիարիզացիան ASR-ի հետ միասին, ստուգել ներկայացուցչական աուդիոյի վրա, նախքան պատասխանատու գործընթացներում օգտագործելը։ Մոդելը տարածվում է OpenMDW License Agreement-ի 1.1 տարբերակով, աշխատում է NVIDIA Ampere, Hopper կամ Blackwell GPU-ներով և հասանելի է Hugging Face Spaces ցուցադրությունում։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։