
Մեծ մոդելները լուծում չեն. GPT-5.5-ի հալյուցինացիաները՝ 86%, GLM-5.2-ինը՝ 28%
arrowtsx.dev-ի վերլուծությունը պնդում է, որ պարամետրերի մրցավազքը սպառվել է. MIT լիցենզիայով բաց մոդել GLM-5.2-ը չափանիշներում գրեթե հասել է GPT-5.5-ին, իսկ ճշգրտությամբ զգալիորեն գերազանցում է նրան։
Առաջատար արհեստական բանականության լաբորատորիաներն ավելի ու ավելի են կասկածում այն ենթադրությանը, թե պարամետրերի քանակի ու ուսուցման տվյալների անվերջ աճը ինքնաբերաբար ավելի լավ մոդելներ է տալիս։ arrowtsx.dev-ում հունիսի 18-ին հրապարակված վերլուծության հեղինակը պնդում է, որ մասշտաբավորումը հասել է առաստաղին, իսկ չափազանց մեծ չափսն այժմ կապված է այլ խնդրի հետ՝ մոդելների, որոնք չեն ընդունում իրենց անորոշությունը։
Չափանիշները և պարամետրերի մրցավազքը
Տեքստը սկսվում է անսովոր օրինակով. Claude Fable 5-ի հասանելիությունը ԱՄՆ կառավարությունը սահմանափակել է թողարկումից ընդամենը երեք օր անց. հեղինակի խոսքով՝ սա ազգային անվտանգությամբ պայմանավորված ԱՄՆ-ի առաջին արգելքն է ԱԲ մոդելի նկատմամբ, որի պատճառը մեկ jailbreak-ի ռիսկն էր։ Միևնույն ժամանակ Z.ai-ի բաց կշիռներով GLM-5.2 մոդելը (753 միլիարդ պարամետր, ակտիվ՝ մոտ 40 միլիարդ) Artificial Analysis Intelligence Index-ում GPT-5.5-ից հետ է ընդամենը 4 կետով, իսկ Fable 5-ից՝ 9 կետով։ Opus 4.8-ը և GPT-5.5-ը փակ մոդելներ են, որոնք պահպանողական գնահատմամբ ունեն 1–2 տրիլիոն պարամետր։ Երբ MIT լիցենզիայով բաց մոդելը այդքան մոտենում է մեկուկես-երկու անգամ ավելի մեծ փակ մոդելին, հեղինակի եզրակացությամբ՝ ինտելեկտի աճը գործնականում կանգ է առել։
Հալյուցինացիաների մակարդակը
Վերլուծության երկրորդ մասը ճշգրտությանն է նվիրված։ AA-Omniscience չափանիշում DeepSeek V4 Pro-ն (1.6 տրիլիոն պարամետր, 49 միլիարդ ակտիվ) արձանագրում է 94% հալյուցինացիա. այն հարցերում, որոնց պատասխանը չգիտեր, դա ընդունել է միայն մոտ 6% դեպքերում։ GLM-5.2-ը ստացել է 28%, Opus 4.8-ը՝ 36%, Fable 5-ը՝ 48%, իսկ GPT-5.5-ը՝ 86%։ Հեղինակի կարծիքով՝ հսկայական ծավալի փաստական տվյալներով ուսուցանված մոդելները սովորում են միշտ պատասխան տալ, այլ ոչ թե ասել «չգիտեմ»։
Թեստ և չլուծված եռակողմ խնդիր
Սա ցույց տալու համար երկու մոդելներին էլ տրվել է Python-ի բարդ հարց՝ ակնհայտ ճարտարապետական թերությամբ, բարձր reasoning effort-ով և temperature 1-ով, OpenRouter-ի միջոցով։ DeepSeek V4 Pro-ն ծախսել է գրեթե տասն անգամ ավելի շատ դատողության թոքեններ և այնուամենայնիվ ինքնավստահ սխալ պատասխան տվել։ GLM-5.2-ին պահանջվել է մոտ 12 վայրկյան և 800 թոքեն՝ գիտակցելու, որ միաշղթա խնդիրը չի կարող իրականացնել մուլտիպլեքսացված I/O առանց կառավարման զիջման։ Առանձին փորձարկման ժամանակ DeepSeek V4 Pro-ն 3 րոպե 26 վայրկյան այրել է դատողության ցիկլում, որից հետո ներկայացրել լավ ձևաչափված, բայց սխալ լուծում։
Եզրակացությունն այն է, որ մոդելների ուսուցումն ու ընտրությունը պետք է կառուցվեն չլուծված եռակողմ խնդրի շուրջ՝ հում հնարավորություններ, անորոշության չափաբերում և հաշվողական արդյունավետություն։ Մոդելն ընտրելը միայն չափսով կամ վարկանիշային աղյուսակում զբաղեցրած տեղով, զգուշացնում է հեղինակը, ավելի ու ավելի հաճախ նշանակում է ընտրել համակարգ, որը համոզիչ կերպով կպաշտպանի սխալ պատասխանը։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։