უკან დაბრუნება
JevBench v1.4.1 — რეპროდუცირებადი ბენჩმარკი ტიპიზებული გადაწყვეტილების მოდელებისთვის
SiTech AI Team2 წთ. საკითხავი

JevBench v1.4.1 — რეპროდუცირებადი ბენჩმარკი ტიპიზებული გადაწყვეტილების მოდელებისთვის

Benchmark Heaven-მა JevBench v1.4.1 გამოაქვეყნა — რეპროდუცირებადი ბენჩმარკი Jev-კლასის, ანუ ტიპიზებული გადაწყვეტილების, მოდელებისთვის. შეფასდა 82 სისტემა 534 საჯარო და 308 დახურულ გადაწყვეტილებაზე; სიის სათავეში TypeSafe AI-ის Jev 1.13.0 დგას 63,3 ქულით.

Benchmark Heaven-მა 23 სექტემბერს JevBench v1.4.1 გამოაქვეყნა — რეპროდუცირებადი ბენჩმარკი Jev-კლასის, ანუ ტიპიზებული გადაწყვეტილების, მოდელებისთვის. ასეთი მოდელი იღებს მდგომარეობასა და შეზღუდულ შეფასების წესებს, სანაცვლოდ კი ტიპიზებულ პასუხს აბრუნებს. JevBench v1.4.1 აფასებს 82 სისტემას 534 საჯარო და 308 დახურულ გადაწყვეტილებაზე; რეიტინგში 77 მათგანია. სიას TypeSafe AI-ის Jev 1.13.0 უძღვის 63,3 ქულით, მის უკან კი მხოლოდ 1,3 ქულით ჩამორჩენილი ღია ალტერნატივა JevK5 v0.2.0 დგას.

როგორ ითვლება ქულა

JevBench ოთხ ღერძს აფასებს — ინტელექტი, კალიბრაცია, სიჩქარე და ღირებულება — თითოეული 0-დან 100-მდე; საბოლოო ქულა მათი თანაბარწონიანი ჰარმონიული საშუალოა. დამატებით ორი ბარიერი მოქმედებს: 50-ზე დაბალი ინტელექტი, სიჩქარე ან ღირებულება შედეგს კვადრატულად ამცირებს, ხოლო თუ საჯარო და დახურულ ნაკრებების სიზუსტის სხვაობა 25 პროცენტულ პუნქტს აღემატება, ინტელექტის ქულა მცირდება. უახლესი დამატება დახურული ნაკრებია — მასში 308 ახალი კითხვაა და ის ინტელექტის ქულის 20%-ს იძლევა; საჯაროდ კი მხოლოდ სისტემების დონეზე დაჯგუფებული შედეგები ქვეყნდება. კითხვები, პასუხები და თითოეულ ერთეულზე მიღებული შედეგი დახურული რჩება და ვერსიებს შორის იცვლება. დახურულ ნაკრებზე შემთხვევითი გამოცნობის ალბათობა 29,3%-ს შეადგენს.

რეიტინგი

Jev 1.13.0-ს 63,3 ქულა აქვს — ინტელექტი 53,1, კალიბრაცია 76,3, სიჩქარე 83,3, ღირებულება 52,0 — და 1000 გადაწყვეტილებაზე $0,040 უჯდება. მას მოსდევს JevK5 v0.2.0 (62,0; ~$0,022 შეფასებით), Hopper (59,4), Winnow-12B Q8 (55,6), reflex 4B (54,0) და djev (52,2; გამოცხადებული ფასი $0,026). ყველაზე ძლიერ ზოგადი დანიშნულების მოდელს, GPT-6 Luna-ს, უმაღლესი ინტელექტი (97,4) და დახურულ ნაკრებზე საუკეთესო სიზუსტე (95,5%) აქვს, თუმცა ის მხოლოდ 30-ე ადგილზეა: სიჩქარისა და ღირებულების დაბალი ქულები ჰარმონიულ საშუალოში ვერ ანაზღაურდება.

რას აჩვენებს შედეგი

საჯარო ნაკრები ლიდერებისთვის თითქმის გაჯერებულია — Jev 1.13.0 მასზე კითხვების 86,6%-ს სწორად პასუხობს — დახურული ნაკრები კი გაცილებით რთულია: 36,7%. ტოპ სისტემებში ორ ნაკრებს შორის სხვაობა დაახლოებით 48–57 პროცენტული პუნქტია, რაც განზოგადების ჯარიმას ააქტიურებს. თავად ბენჩმარკის ავტორები 534 გადაწყვეტილების საჯარო ნაკრებს პილოტს უწოდებენ, აღნიშნავენ, რომ ის მხოლოდ ინგლისურად არის, და აფრთხილებენ: დახურული კითხვების ტექსტი მაინც უგზავნიან შეფასებულ სერვისებს, ამიტომ „დახურული“ და „უხილავი“ ერთი და იგივე არ არის. ტესტის ჰარნესი, საჯარო ამოცანები და შეფასების წესები MIT ლიცენზიით ვრცელდება. Jev-ზე აწყობილი სერვისი classifier.dev 70,8 ქულას აღწევს, მაგრამ რეიტინგში არ შედის — წინააღმდეგ შემთხვევაში ერთი და იგივე მოდელი ორჯერ შეფასდებოდა. ცალკე, დამოუკიდებელი ანალიზი, რომელიც იმავე დღეს გამოქვეყნდა (Alex Molas), ამტკიცებს, რომ გადაწყვეტილების მოდელის ალბათობები თვითნებურ მონაცემებზე კალიბრირებული ვერ დარჩება და მათ ქულებად უნდა მოვეპყრათ, ალბათობებად კი არა.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.