
Amazon-მა Jev-ის ანალოგი, Strands Decider 2B, გამოუშვა
Amazon Web Services-მა ღია წყაროს მოდელი Strands Decider 2B წარადგინა, რომელიც ტექსტის გენერაციის ნაცვლად წინასწარ განსაზღვრულ ვარიანტებს შორის ირჩევს, ლოკალურად მუშაობს და პასუხის სანდოობას ქულით ზომავს.
1 ოქტომბერს Amazon Web Services-მა ღია წყაროს მოდელი Strands Decider 2B წარადგინა. ის ტექსტის გენერაციის ნაცვლად წინასწარ განსაზღვრულ ვარიანტებს შორის ირჩევს და პასუხის სანდოობას ქულით ზომავს. იმავე კვირას OpenAI-მ მსგავსი Decisions API შეზღუდული რეჟიმით წარადგინა.
მოდელი TypeSafe-ის Jev-ის იდეაზეა აგებული. Amazon-ის გამორჩეულმა ინჟინერმა Marc Brooker-მა საკუთარი ვერსია ააწყო, რომელმაც JevBench-ის რეიტინგში თავისი ზომის მოდელებს შორის მოკლე დროით პირველი ადგილიც დაიკავა. Amazon-მა პროექტი გაასუფთავა და Strands Labs-მა გამოუშვა.
როგორ მუშაობს
Strands Decider 2B Alibaba-ს ღია მოდელ Qwen3.5-2B-ზეა აგებული: AWS-მა მას ტექსტის გენერაციის ნაწილი ამოაკლო და ჩაანაცვლა მექანიზმით, რომელიც შემოთავაზებულ პასუხებს აფასებს. მას მილიონზე ოდნავ მეტი პარამეტრი აქვს, ძირითადი კორპუსი კი rank-16 LoRA ადაპტერს იყენებს. პასუხების შეზღუდული სივრცის გამო მოდელი ვერ მოიგონებს ისეთ ვარიანტს, რომელიც არავის შემოუთავაზებია.
მაგალითად, მომხმარებელი ამინდზე კითხულობს ქალაქის დასახელების გარეშე: აგენტი ქალაქს ვარაუდობს და ამინდის ხელსაწყოს გამოძახებას გეგმავს, თუმცა გამოძახებამდე Decider ამოწმებს, ეყრდნობა თუ არა არგუმენტები საუბარს. შემოწმება Strands-ის ჩარევის სისტემაზე გადის: გამოძახება შეიძლება გაგრძელდეს ან აიკრძალოს. დემონსტრაციაში Decider ლოკალურად მუშაობს.
შედეგები
JevBench-ის საჯარო კრებულზე, AWS-ის თქმით, მოდელი დაახლოებით 2 მილიარდი პარამეტრის საჯარო მოდელებს შორის მეორე ადგილზეა, პირველზე კი მათ შორის, ვინც სრულ გაწვრთნის რეცეპტს აქვეყნებს. მარტივი დონის ყველა კითხვას ის სწორად პასუხობს, გადაწყვეტილებას კი 100 მილიწამზე ნაკლებ დროში იღებს NVIDIA RTX 3090-ზე. გამოშვებაში გაწვრთნის მონაცემები და სკრიპტებიც შედის.
რატომ არის მნიშვნელოვანი
TypeSafe-ის Jev რამდენიმე კვირის წინ გამოვიდა და მსგავსი მოდელების ტალღა დაიწყო: მას Kev, imajev, Laya და სხვა პროექტები მოჰყვა, ახლა კი მსხვილი კომპანიებიც უერთდებიან. Brooker-ის აზრით, გამოწვევა სწრაფი გადაწყვეტილების გაუმჯობესებაა ინტელექტის შელახვის გარეშე; მცირე ბაზრისთვის საინტერესო მოდელის აწყობა კი ასობით ან ათასობით დოლარი ღირს.
TypeSafe ამჟამად მომავალ მოდელებზე მუშაობს. დამფუძნებელმა და CEO Diogo Almeida-მ TechCrunch-ს უთხრა: „მესმის, რომ ხალხს ეს ოქროს ციებ-ცხელება ჰგონია, მაგრამ შეიძლება უგულებელყოფენ, რამდენად რთულია მოდელების ნამდვილად ჭკვიანად გაკეთება“. ღია რჩება კითხვა, იქნება თუ არა მოდელი AWS-ის ღრუბელშიც ხელმისაწვდომი.
წყაროები: TechCrunch · The New Stack · Techmeme
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.