
JevBench v1.4.1 — վերարտադրելի բենչմարկ տիպավորված որոշումների մոդելների համար
Benchmark Heaven-ը հրապարակել է JevBench v1.4.1-ը՝ վերարտադրելի բենչմարկ տիպավորված որոշումների մոդելների համար։ 82 համակարգեր գնահատվել են 534 հրապարակային և 308 փակ որոշումների վրա, առաջատարը TypeSafe AI-ի Jev 1.13.0-ն է՝ 63,3 միավորով։
Benchmark Heaven-ը հրապարակել է JevBench v1.4.1-ը՝ վերարտադրելի բենչմարկ Jev դասի որոշումների մոդելների համար. նման մոդելները ստանում են վիճակ և սահմանափակ կանոնների հավաքածու, իսկ վերադարձնում են տիպավորված պատասխան։ 2026 թ. սեպտեմբերի 23-ին գնահատված տարբերակն ընդգրկում է 82 համակարգ 534 հրապարակային և 308 փակ որոշումների վրա, դրանցից 77-ը դասակարգված են։ Առաջին տեղում TypeSafe AI-ի Jev 1.13.0-ն է՝ 63,3 միավորով, իսկ բաց այլընտրանքը՝ JevK5 v0.2.0-ը, ընդամենը 1,3 միավոր է զիջում։
Ինչպես է հաշվարկվում միավորը
JevBench-ը միավորում է չորս առանցք՝ Ինտելեկտ, Կալիբրացիա, Արագություն և Արժեք, ամեն մեկը 0-100 սանդղակով, հավասարակշիռ հարմոնիկ միջինով։ Այնուհետև գործում են երկու սահմանափակիչներ՝ 50-ից ցածր Ինտելեկտը, Արագությունը կամ Արժեքը քառակուսի կարգով իջեցնում է արդյունքը, իսկ հրապարակային և փակ հավաքածուների ճշգրտության տարբերությունը 25 տոկոսային կետից բարձր լինելու դեպքում նվազում է Ինտելեկտի միավորը։ Նորագույն հավելումը փակ հավաքածուն է. 308 նոր գաղտնի որոշումները տալիս են Ինտելեկտի միավորի 20%-ը, իսկ հրապարակվում են միայն համակարգի մակարդակով ագրեգատները. հարցերի տեքստը, պատասխանները և յուրաքանչյուր կետի արդյունքները մնում են գաղտնի և փոխվում են տարբերակների միջև։ Փակ հավաքածուում պատահական գուշակման հավանականությունը 29,3% է։
Դասակարգումը
Jev 1.13.0-ը հավաքում է 63,3 միավոր (Ինտելեկտ 53,1, Կալիբրացիա 76,3, Արագություն 83,3, Արժեք 52,0) և արժե 0,040 դոլար 1000 որոշման հաշվով։ Նրան հաջորդում են JevK5 v0.2.0 (62,0, ~0,022 դոլար գնահատականով), Hopper (59,4), Winnow-12B Q8 (55,6), reflex 4B (54,0) և djev (52,2, հայտարարված 0,026 դոլար գին)։ Ամենաուժեղ ընդհանուր մոդելը՝ GPT-6 Luna-ն, ունի ամենաբարձր Ինտելեկտը (97,4) և ամենալավ փակ ճշգրտությունը (95,5%), սակայն զբաղեցնում է միայն 30-րդ տեղը. ցածր Արագությունն (72,6) ու Արժեքը (36,0) հարմոնիկ միջինում չեն փոխհատուցվում։
Ինչ է սա ասում Jev դասի մոդելների մասին
Հրապարակային հարցերը առաջատարների համար գրեթե սպառված են՝ Jev 1.13.0-ը ճիշտ է պատասխանում դրանց 86,6%-ին, իսկ փակ հավաքածուն շատ ավելի դժվար է՝ 36,7%։ Առաջատար համակարգերի մոտ մոտ 48–57 կետի տարբերությունը ակտիվացնում է ընդհանրացման տուգանքը։ Բենչմարկի սեփական նշումները 534 որոշման հավաքածուն անվանում են պիլոտ, նշում են, որ այն միայն անգլերեն է, և զգուշացնում են, որ փակ հարցերի տեքստը նույնպես ուղարկվում է գնահատվող ծառայություններին։ Թեստային ենթակառուցվածքը, հրապարակային առաջադրանքները և գնահատման կանոնները MIT արտոնագրով են։ Jev-ի վրա աշխատող classifier.dev ծառայությունը ստացել է 70,8 միավոր, սակայն դասակարգված չէ, քանի որ դա նույն մոդելին կդասակարգեր երկու անգամ։ Նույն օրը հրապարակված անկախ վերլուծությունը պնդում է, որ որոշումների մոդելի հավանականությունները չեն կարող կալիբրացված մնալ կամայական տվյալների վրա, և դրանք պետք է դիտել որպես միավորներ, ոչ թե հավանականություններ։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։