Վերադառնալ
GLM-5.2-ը դարձել է Artificial Analysis-ի առաջատար բաց կշիռներով մոդելը
SiTech AI Team2 წთ. საკითხავი

GLM-5.2-ը դարձել է Artificial Analysis-ի առաջատար բաց կշիռներով մոդելը

Z.ai-ի GLM-5.2-ը Artificial Analysis Intelligence Index v4.1-ում հավաքում է 51 միավոր՝ առաջ անցնելով MiniMax-M3-ից, DeepSeek V4 Pro-ից և Kimi K2.6-ից, և հայտնվում է ինտելեկտի ու առաջադրանքի արժեքի Պարետոյի սահմանին։

Z.ai-ի GLM-5.2-ը դարձել է Artificial Analysis Intelligence Index-ի նոր առաջատար բաց կշիռներով մոդելը՝ չափիչի 4.1 տարբերակում հավաքելով 51 միավոր։ Վերլուծական ընկերության տվյալներով՝ մոդելը պահպանել է նախորդ GLM-5.1-ի նույն չափը՝ ընդհանուր 744 միլիարդ պարամետր և 40 միլիարդ ակտիվ, սակայն ինդեքսում ավելացրել է 11 միավոր։

Իր դիրքը ցանկում

Այս արդյունքը GLM-5.2-ին առաջ է դնում այլ բաց թողարկումներից. MiniMax-M3-ը և DeepSeek V4 Pro-ն (max) ստանում են 44 միավոր, իսկ Kimi K2.6-ը՝ 43։ GDPval-AA v2-ում՝ Artificial Analysis-ի հիմնական չափիչում իրական ագենտային աշխատանքի համար, GLM-5.2-ը հավաքում է 1 524 միավոր՝ առաջ անցնելով MiniMax-M3-ից (1 418) և DeepSeek V4 Pro-ից (max, 1 328), իսկ xhigh ռեժիմում գտնվող GPT-5.5-ի (1 514) հետ գործնականում նույն մակարդակին է։

Աճը գնահատումներում

GLM-5.1-ի համեմատ բարելավումը երևում է գնահատումների մեծ մասում, հատկապես գիտական դատողության մեջ։ CritPt-ը աճում է 16 միավորով՝ մինչև 21 տոկոս, HLE-ն՝ 12 միավորով՝ մինչև 40 տոկոս, SciCode-ը՝ 7 միավորով՝ մինչև 50 տոկոս։ AA-LCR-ը բարձրանում է 9 միավորով՝ մինչև 71 տոկոս, tau3 բանկային թեստը՝ 15 միավորով՝ մինչև 27 տոկոս, TerminalBench v2.1-ը՝ 16 միավորով՝ մինչև 78 տոկոս։ GPQA Diamond-ը ավելանում է 3 միավորով՝ հասնելով 89 տոկոսի։

Արժեք և հուսալիություն

GLM-5.2-ը նաև ինտելեկտի ու առաջադրանքի արժեքի գրաֆիկի Պարետոյի սահմանին է. իր ինտելեկտի մակարդակում այն ունի ամենացածր արժեքը մեկ առաջադրանքի համար։ AA-Omniscience Index-ում մոդելը ստանում է 4 միավոր՝ GLM-5.1-ի 2-ի փոխարեն. ճշգրտությունը 24,2-ից բարձրացել է 25,1 տոկոսի, հալյուցինացիաների ցուցանիշը 29,4-ից իջել է 28,1 տոկոսի, իսկ փորձերի ցուցանիշը մնացել է անփոփոխ՝ 47 տոկոս։ Մեկ առաջադրանքի համար մոդելը ծախսում է շուրջ 43 000 ելքային թոքեն, որից 37 000-ը դատողության թոքեններ են։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։