უკან დაბრუნება
NVIDIA-მ Nemotron 3 Diarization გამოუშვა — რეალურ დროში რვა მოსაუბრეს არჩევს
SiTech AI Team2 წთ. საკითხავი

NVIDIA-მ Nemotron 3 Diarization გამოუშვა — რეალურ დროში რვა მოსაუბრეს არჩევს

NVIDIA-მ ღია მოდელი Nemotron 3 Diarization გამოუშვა. 100 მილიონი პარამეტრის მქონე სისტემამ Voice Arena-ს Diarization-Bench-ზე პირველი ადგილი დაიკავა დიარიზაციის 14,72%-იანი შეცდომით და რეალურ დროში რვა მოსაუბრეს არჩევს.

NVIDIA-მ ახალი ღია მოდელი — Nemotron 3 Diarization — გამოუშვა. მოდელი 100 მილიონი პარამეტრისგან შედგება და საუბარში ადგენს, ვინ როდის ლაპარაკობს. Voice Arena-ს Diarization-Bench-ის პირველ შედეგებში მან 12 სისტემას შორის პირველი ადგილი დაიკავა: შეფასებამ 139 ინგლისურენოვანი საუბარი მოიცვა — დაახლოებით 22 საათი აუდიო. მოდელის დიარიზაციის შეცდომის მაჩვენებელი (DER) 14,72% აღმოჩნდა, მომდევნო სისტემისა კი 19,3% — დაახლოებით 24%-იანი შედარებითი გაუმჯობესება. აღწერა 23 სექტემბერს Hugging Face-ის ბლოგზე გამოქვეყნდა.

მეტყველების ამოცნობა აფიქსირებს, რა ითქვა, დიარიზაცია კი ადგენს, ვინ თქვა: ის ნიშნავს დროის ინტერვალებს, რომლებშიც თითოეული მოსაუბრე აქტიურია. ASR-ის ტექსტთან შერწყმით მოსაუბრეზე მიბმული ტრანსკრიპტი მიიღება.

როგორ მუშაობს მოდელი

Nemotron 3 Diarization 16 kHz ერთარხიან აუდიოს იღებს და Mel-სპექტროგრამის მახასიათებლებად გარდაქმნის 10 მილიწამიანი ნაბიჯით; მახასიათებლები რვაჯერ დაწყობილად 80 მილიწამიან კადრებს ქმნის, რომლებსაც 31-შრიანი Transformer-ის ენკოდერი rotary positional embeddings (RoPE)-ის გამოყენებით ამუშავებს. გამოსავალი მოსაუბრის აქტივობის ალბათობების [T, 8] ზომის ტენზორია — T დროის საფეხური რვა არხზე, ამიტომ გადაფარული მეტყველების დროს ერთ კადრში ორი არხი შეიძლება იყოს აქტიური.

სტრიმინგში მოსაუბრეთა ნომრებს ორი მეხსიერების მექანიზმი ინარჩუნებს: Arrival-Order Speaker Cache (AOSC) წინა ნაწილებში დანახული მოსაუბრეების კონტექსტს ინახავს, FIFO რიგი კი ბოლო კადრებს აწვდის. მოდელი მოსაუბრეებს გამოჩენის მიხედვით ალაგებს — პირველი ახალი ხმა პირველი არხი ხდება. NVIDIA-ს ცნობით, სავარჯიშო მონაცემებში David AI-სგან ლიცენზირებული აუდიოს დამატებამ შემადგენელი DER 0,77 პუნქტით შეამცირა — 11,19%-დან 10,42%-მდე.

სიზუსტე და დაყოვნება

DER სამი ტიპის შეცდომას აერთიანებს: გამოტოვებულ მეტყველებას, ცრუ აქტივაციას და მოსაუბრის არასწორ მიკუთვნებას. მოდელი შემავალი ბუფერის ოთხ რეკომენდებულ დაყოვნებას უჭერს მხარს — 30,4, 1,04, 0,64 და 0,32 წამს; 0,32 წამი ყველაზე დაბალი რეკომენდებული რეჟიმია. რაც შეეხება 1,04 წამიან დაყოვნებას, DER რვავე შეფასების პირობაში გაუმჯობესდა: შედარებითი კლება 9,0%-დან (CALLHOME-Part2) 65,2%-მდე (NOTSOFAR1 MHM) მერყეობს, რვა მაჩვენებლის შეუწონავი საშუალო კი 41,0%-ია. ერთადერთი გამონაკლისი ორმოსაუბრიანი CALLHOME-ის ქვეჯგუფია: ახალი მოდელი 5,98%-ს აჩვენებს, წინა — 5,68%-ს.

გამტარუნარიანობაც გაიზარდა: 30,4 წამიან კონფიგურაციაში მოდელი 15 113× RTFx-ს აღწევს batch size 32-ზე torch.compile()-ით, წინა მოდელის 2 619×-ის ნაცვლად, DIHARD III-ის DER კი 19,09%-დან 12,73%-მდე ამცირებს. 1,04 წამიან რეჟიმში ეს მაჩვენებლები 865× და 136×-ია, DER-ი კი 19,60%-დან 13,18%-მდე ეცემა.

შეზღუდვები და ხელმისაწვდომობა

მოდელი მაქსიმუმ რვა მოსაუბრეს უმკლავდება; მეტი მონაწილის შემთხვევაში მეტყველება შეიძლება დაიკარგოს ან არასწორ არხს მიეკუთვნოს. NVIDIA-ს რეკომენდაციით, სანამ მოსაუბრეთა მიკუთვნებას პასუხისმგებლიან პროცესებში გამოიყენებენ, მთელი კონვეიერი — დიარიზაცია ASR-თან ერთად — რეალურ აუდიოზე უნდა შემოწმდეს. მოდელი OpenMDW License Agreement-ის 1.1 ვერსიის პირობებით ვრცელდება, NVIDIA Ampere, Hopper ან Blackwell GPU-ებზე მუშაობს და Hugging Face Spaces-ის დემოშიცაა წარმოდგენილი.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.