
Ember-1 და Kimi K3: თითქმის ერთნაირი შედეგი, 3,4-ჯერ მაღალი სიჩქარე
Fireworks Research-მა 23 სექტემბერს Ember-1 წარადგინა, რომელიც Kimi K3-ის ბაზაზეა აგებული. დამოუკიდებელ ტესტებში ორივე მოდელმა თითქმის იდენტური სიზუსტე აჩვენა, Ember-1 კი 3,4-ჯერ უფრო სწრაფი აღმოჩნდა.
Fireworks Research-მა 23 სექტემბერს კვლევითი გამოშვების სახით წარადგინა მოდელი Ember-1, რომელიც Moonshot-ის ღია წონების მოდელ Kimi K3-ზეა აგებული. კომპანიის მტკიცებით, ახალი მოდელი Kimi K3-ის ხარისხს დაახლოებით 40%-ით ნაკლები token-ით აღწევს. „მან ისწავლა ზედმეტი მსჯელობის შემცირება, საჭირო ფიქრის შენარჩუნებით“, აცხადებს Fireworks Research. მსჯელობის token-ები output-ის ტარიფით იანგარიშება, ამიტომ ნაკლები ფიქრი იაფია.
OpenRouter-ზე Ember-1-ის ფასი მილიონ input token-ზე 3 დოლარია, output token-ზე 15 დოლარი. Fireworks იმავეს ითხოვს Kimi K3-ზეც, თუმცა სხვა პროვაიდერები Kimi-ს მილიონ input token-ზე 1 დოლარად და output token-ზე 9 დოლარად ყიდიან.
როგორ ჩატარდა ტესტირება
გამოცემა The New Stack-მა ორივე მოდელი OpenRouter-ის გავლით, ერთნაირი მოთხოვნებითა და ნაგულისხმევი პარამეტრებით გაუშვა და სამართლიანი შედარებისთვის ორივე Fireworks-ზე გადაამისამართა. თითოეული ტესტი ხუთჯერ შესრულდა, მსჯელობის token-ები კი დანარჩენი output-ისგან ცალკე აღირიცხა.
სამი ტიპის ამოცანა თანდათან რთულდებოდა: ლოგიკური თავსატეხები 4, 5 და 7 ინჟინერით; გაშვების განრიგი 12 სერვისით, დამოკიდებულებებით, ორი „ბლექაუთის“ ფანჯარითა და 17-საათიანი ოპტიმალური გეგმით; და ალბათობის ხუთი კითხვა განმეორებითი მოთხოვნის სისტემაზე, სადაც პასუხები ზუსტი წილადებია. პასუხები ორი დამოუკიდებელი მეთოდით გადამოწმდა.
შედეგები
ლოგიკურ თავსატეხებში ორივე მოდელმა სამივე ამოცანა ხუთივე გაშვებაზე სწორად ამოხსნა. Ember-1-ს საშუალოდ 13 630 მსჯელობის token, 3 წუთი 46 წამი და 0,27 დოლარი დასჭირდა, Kimi K3-ს კი 16 679 token, 12 წუთი 26 წამი და 0,34 დოლარი. ეს 18%-ით ნაკლები მსჯელობის token-ია. Kimi K3-ის ყველაზე ნელი გაშვება თითქმის 20 წუთს გაგრძელდა.
გაშვების განრიგში ორივემ 17-საათიანი გეგმა იპოვა და ყველა გეგმამ შემმოწმებელი ტესტი გაიარა. Ember-1-ს 6 543 token და 1 წუთი 29 წამი დასჭირდა, Kimi K3-ს 7 792 token და 4 წუთი 46 წამი. ალბათობის ტესტზე ერთადერთი შეცდომა დაფიქსირდა: Kimi K3-მა ყველა პასუხი სწორად გასცა ხუთივე გაშვებაზე, Ember-1-მა კი მხოლოდ ოთხზე. მეხუთეზე მცირე არითმეტიკული შეცდომა დაუშვა, 0,94629-ის ნაცვლად 0,94619 დაწერა და ეს ხარვეზი ორ სხვა პასუხშიც გადავიდა.
ჯამში Kimi K3-მა 15-დან 15 გაშვება შეასრულა უშეცდომოდ, Ember-1-მა 15-დან 14. Fireworks-ის ტარიფებით ტესტების ჯამური ღირებულება Ember-1-ისთვის 2,48 დოლარი იყო, Kimi K3-ისთვის 3,26 დოლარი, ანუ Ember-1 დაახლოებით 24%-ით იაფია. თუმცა Kimi K3-ის ფასი პროვაიდერზეა დამოკიდებული: მინიმალურ ტარიფზე იგივე ტესტები 1,96 დოლარი დაჯდებოდა, Ember-1-ზე ნაკლები.
რას ნიშნავს ეს პრაქტიკაში
მარკეტინგულ მასალებში არ ფიგურირებდა ის ფაქტი, რომ Ember-1 ტესტების თითოეულ კომპლექტს Kimi K3-ზე 3,4-ჯერ უფრო სწრაფად ასრულებდა, მსჯელობის token-ებს კი მთლიანობაში 23%-ით ნაკლებს ხარჯავდა. ავტორის დასკვნით, სიზუსტით ორივე მოდელი ერთ დონეზეა. ვისაც თითქმის იდენტური შედეგი მაქსიმალურად სწრაფად სჭირდება, Ember-1 ჯობია; ვისთვისაც ფასი მთავარია, იაფ პროვაიდერზე გადამისამართებული Kimi K3 უფრო იაფი გამოდის.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.