
Qwen3.8 Max Artificial Analysis-ის აგენტური ინდექსის სათავეშია
Alibaba-ს ფლაგმანური მოდელი Qwen3.8 Max Artificial Analysis-ის აგენტურ ინდექსში პირველ ადგილზეა — რეიტინგში, რომელიც ზომავს, რამდენად ასრულებენ AI სისტემები გრძელვადიან სამუშაო ამოცანებს და არა საგამოცდო კითხვებს.
დამოუკიდებელი შეფასების პლატფორმა Artificial Analysis-ის აგენტურ ინდექსს ახალი ლიდერი ჰყავს: Qwen3.8 Max — Alibaba-ს ფლაგმანური მსჯელობის (reasoning) მოდელი, რომელიც 2026 წლის 3 აგვისტოს გამოვიდა. რეიტინგი მოდელს ინდექსის სათავეში ათავსებს — ინდექსისა, რომელიც სპეციალურად აგენტური სამუშაოსთვისაა აგებული: ამოცანებისთვის, სადაც სისტემამ უნდა დაგეგმოს, გამოიყენოს ინსტრუმენტები და საბოლოო შედეგი ჩააბაროს, და არა უბრალოდ კითხვას უპასუხოს.
რას ზომავს ინდექსი
აგენტური ინდექსი ეყრდნობა იმ შეფასებებს, რომლებსაც Artificial Analysis დამოუკიდებლად ატარებს. მათ შორისაა AA-Briefcase v1.1, რომელიც გრძელვადიან კოგნიტურ სამუშაოს ამოწმებს შედეგებით, როგორიცაა ცხრილები, პრეზენტაციები და მემორანდუმები; GDPval-AA v2.1 — რეალურ სამუშაო ამოცანებზე დაფუძნებული; AutomationBench-AA — SaaS სამუშაო პროცესებისთვის; და Terminal-Bench 4.0 — კოდირებისა და ტერმინალის გამოყენებისთვის. ეს აგენტური ტესტები კლასიკურ კოგნიტურ ბენჩმარკებს გვერდით დგას პლატფორმის უფრო ფართო Intelligence Index-ში, რომელიც ამჟამად ათ შეფასებას აერთიანებს.
მოდელი, რომელიც რეიტინგს უდგას სათავეში
Qwen3.8 Max დახურული მსჯელობის მოდელია — Alibaba მისი პარამეტრების რაოდენობას არ ასაჯაროებს. ის იღებს ტექსტს, სურათსა და ვიდეოს, აბრუნებს ტექსტს და მილიონი ტოკენის კონტექსტურ ფანჯარას გვთავაზობს. Artificial Analysis-ის Intelligence Index-ზე მოდელი 40 ქულას იღებს — მნიშვნელოვნად მაღლა შედარებადი მოდელების მედიანური 24 ქულისგან. კომპრომისი სიჩქარესა და სიტყვიერებაზე მოდის: მოდელი წამში დაახლოებით 41 ტოკენს გამოიმუშავებს — თავის კლასში ნელია — და შეფასების დროს დაახლოებით 180 მილიონი ტოკენი დახარჯა, მედიანური მაჩვენებელის ორმაგი. API-ს ფასი მილიონ შემავალ ტოკენზე 2 დოლარია, გამომავალზე — 6 დოლარი, ქეშირებულ შემავალზე კი 88-პროცენტიანი ფასდაკლება მოქმედებს.
რატომ არის ეს მნიშვნელოვანი
აგენტური ბენჩმარკები დარგის მთავარ საზომად იქცა, რადგან ისინი ანაზღაურებად სამუშაოს ჰგავს და არა ვიქტორინას, და მათი „მოტყუება“ დამახსოვრებული პასუხებით ბევრად უფრო რთულია. ის რომ ამ რეიტინგს Alibaba-ს დახურული მოდელი უდგას სათავეში, იმაზე მეტყველებს, სადაც პრაქტიკული ხელოვნური ინტელექტის ფრონტი გადაინაცვლა: კონკურენცია ახლა იმაზეა, რამდენად საიმედოდ ასრულებენ მოდელები მრავალსაფეხურიან დავალებებს და რა უჯდება ეს საიმედოობა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.