უკან დაბრუნება
Alibaba-მა Qwen Audio 3.1 გამოუშვა: ხუთი ახალი მოდელი და ფასების 95%-მდე კლება
SiTech AI Team2 წთ. საკითხავი

Alibaba-მა Qwen Audio 3.1 გამოუშვა: ხუთი ახალი მოდელი და ფასების 95%-მდე კლება

Alibaba-ის Qwen-მა Qwen Audio 3.1 წარადგინა — ხუთი მოდელი მეტყველების ამოცნობის, ტექსტის ხმად გადაქცევისა და რეალურ დროში ხმოვანი ურთიერთქმედებისთვის. კომპანიამ TTS-ის ფასი დაახლოებით 70%-ით, realtime მოდელის 85%-ით, ხოლო ამოცნობის 95%-მდე შეამცირა.

Alibaba-ის AI გუნდმა Qwen-მა Qwen Audio 3.1 წარადგინა — ხუთი მოდელის ოჯახი მეტყველების ამოცნობისთვის (ASR), ტექსტის ხმად გადაქცევისთვის (TTS) და რეალურ დროში ხმოვანი ურთიერთქმედებისთვის. გამოშვებასთან ერთად კომპანიამ აუდიო API-ების ფასები მკვეთრად დაწია: TTS დაახლოებით 70%-ით, realtime მოდელი — 85%-ით, ხოლო ამოცნობა — 95%-მდე.

რას აკეთებს ხუთი მოდელი

მეტყველების ამოცნობის ძირითადი მოდელი უკეთ ამუშავებს მრავალენოვან და დიალექტურ ჩანაწერებს და ავტომატურად ასუფთავებს შემავსებელ სიტყვებსა და გამეორებებს — ეს მნიშვნელოვანია ინტერვიუების, ზარებისა და შეხვედრების ჩანაწერების ტრანსკრიფციისთვის რთული დამატებითი დამუშავების გარეშე. ASR-Next კიდევ უფრო შორს მიდის: ამოიცნობს რამდენიმე მოსაუბრეს დროის ნიშნებით, ასევე ემოციებს, ფონურ ხმებსა და ტექნიკის ხმაურს.

სინთეზის მხრივ, TTS მოდელი ტექსტს მრავალ ენაზე აჟღერებს და, Qwen-ის აღწერით, ენებს შორის ხმას ბუნებრივად გადასცემს. ემოციას, სიჩქარესა და სტილს მარტივი ტექსტური მითითებებით მართავენ, მაგალითად: „წაიკითხე მკვეთრი, ბრძანებითი ტონით, რომელიც პატივისცემას მოითხოვს“. TTS-Next კი ენობრივ მოდელს დიფუზიურ მიდგომას უხამებს და ხმას, ხმოვან ეფექტებსა და ფონურ აუდიოს ერთი გავლით ქმნის.

მეხუთე მოდელი რეალურ დროში ურთიერთქმედებაზეა ორიენტირებული: ის ერთდროულად ისმენს და ლაპარაკობს და მომხმარებელს მყისიერად ჩარევის საშუალებას აძლევს. Qwen-ის თანახმად, დათრგუნული განწყობის ამოცნობისას ის უფრო ნელა და მეტი თანაგრძნობით პასუხობს.

ფასების კლება 95%-მდე

ფასების დაწევა განცხადების ყველაზე მნიშვნელოვანი ნაწილია. მეტყველების ამოცნობა, რომელიც ხმოვან პროდუქტებში ჩვეულებრივ ყველაზე დიდი დატვირთვაა, 95%-მდე გაიაფდა; realtime მოდელი — დაახლოებით 85%-ით, ხოლო ტექსტის ხმად გადაქცევა — 70%-ით. მასშტაბურ ტრანსკრიფციაზე ან ხმოვან აგენტებზე მომუშავე გუნდებისთვის ეს აუდიო პროცესების მუდმივად ჩართული მუშაობის ეკონომიკას ცვლის.

Qwen-მა ტექნიკური დეტალები საკუთარ ბლოგზე გამოაქვეყნა, თავად მოდელები კი Qwen Cloud-ზეა ხელმისაწვდომი Qwen Audio 3.1-ის სახელწოდებით.

რატომ არის ეს მნიშვნელოვანი

ხმოვანი ინტერფეისები AI-ის სტეკის ერთ-ერთი ყველაზე კონკურენტული ფენა გახდა და პროვაიდერები ხარისხის პარალელურად ფასზეც ეჯიბრებიან. ამ მასშტაბის შემცირება ამოცნობისა და realtime API-ებში სხვა მოთამაშეებისთვის ზღვარს აწევს და მუდმივად ჩართულ ხმოვან ფუნქციებს — ქოლ-ცენტრებს, ასისტენტებს, ხელმისაწვდომობის ინსტრუმენტებს — ექსპლუატაციაში უფრო იაფს ხდის.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.