Վերադառնալ
«Մոդելները դիտմամբ հիմարանում են». ինչու են լաբորատորիաները գիտելիքը փոխարինում դատողությամբ
SiTech AI Team2 წთ. საკითხავი

«Մոդելները դիտմամբ հիմարանում են». ինչու են լաբորատորիաները գիտելիքը փոխարինում դատողությամբ

Բլոգի հեղինակը պնդում է, որ AI լաբորատորիաները դիտմամբ փոխանակում են աշխարհի գիտելիքը դատողության ունակությամբ. մոդելները լավանում են մաթեմատիկայում, վատանում փաստերի հիշման մեջ։

«Models Are Getting Dumber on Purpose» վերնագրով բլոգ-գրառման հեղինակը պնդում է, որ առաջատար AI լաբորատորիաները դիտմամբ փոխանակում են աշխարհի մասին գիտելիքը դատողության ունակությամբ. մոդելները մեկ թոքենի հաշվով ավելի քիչ հաշվարկով են լուծում մաթեմատիկայի ու կոդի խնդիրները, բայց ավելի վատ են հիշում փաստերը։

Բենչմարքները հակառակ ուղղություններով են գնում

Ըստ գրառման՝ GLM-5.2-ը AIME 2026-ում հավաքում է 99,2%՝ մեկ թոքենի համար մոտ 40 միլիարդ ակտիվ պարամետրով, Qwen3.5-ը՝ 91,3% 17 միլիարդով, իսկ DeepSeek V4-Flash-ը աշխատում է 13 միլիարդով։ 2023-ին GPT-4-ին վերագրում էին մոտ 280 միլիարդ ակտիվ պարամետր, և նա հազիվ էր լուծում AIME-ի խնդիրը։ Qwen3.5 9B-ը քվանտացված տարբերակով տեղավորվում է 6 ԳԲ վիդեոհիշողության մեջ և Artificial Analysis-ի ինդեքսում մոտ երկու անգամ գերազանցում է 10 միլիարդ պարամետրից փոքր լավագույն մոդելի արդյունքը։ Փաստերի հիշման դեպքում պատկերը հակառակն է՝ SimpleQA-ում, որտեղ գործիքներն արգելված են, առաջատարը Gemini 2.5 Pro-ն է՝ 53%, իսկ Qwen3.5 4B և 9B մոդելների հալյուցինացիայի մակարդակը 80–82% է։

Փաստերը հնանում են, ընթացակարգերը՝ ոչ

Գիտելիքի ծավալի հետազոտությունները, այդ թվում «Physics of Language Models» շարքը, գնահատում են մոտ երկու բիթ փաստական գիտելիք յուրաքանչյուր պարամետրի հաշվով։ Հեղինակի կարծիքով՝ դատողությունն ավելի լավ է սեղմվում, քանի որ այն քիչ թվով ընթացակարգերի կրկնվող կիրառում է՝ խնդիրը մասերի բաժանել, հետևել միջանկյալ վիճակին, ստուգել սեփական աշխատանքը, հետ գնալ անհրաժեշտության դեպքում։ Phi-4-ը 14 միլիարդ պարամետրով մոդել է, հիմնականում սինթետիկ՝ դասագրքային ոճի տվյալներով վարժեցված․ ուժեղ է մաթեմատիկայում և թույլ՝ մանր փաստերում։ Փաստերն էլ ունեն պահպանման ժամկետ, հանրահաշիվը՝ ոչ։

Որտեղ է գիտելիքը հիմա

Եթե մոդելները փաստեր չեն պահում, դրանք տրամադրում է արտաքին միջավայրը՝ որոնումը, գործիքների կանչերը, փաստաթղթերը։ Կոդ գրող գործակալին պետք չէ անգիր իմանալ կախվածության API-ն․ նա որոնում է node_modules-ում կամ կարդում է փաստաթղթերը։ Հեղինակը կանխատեսում է, որ մի քանի տարի անց frontier մակարդակի դատողությունը կաշխատի մեկ սպառողական վիդեոքարտի վրա. DeepSeek V4-Flash-ն արդեն դատում է մոտ 13 միլիարդ ակտիվ պարամետրով, իսկ մնացած 271 միլիարդը հիմնականում փաստերի պահոց հանդիսացող փորձագիտական շերտերում է։ Կշիռներում ամրագրված սխալ փաստն առանց լրացուցիչ վարժեցման ուղղել հնարավոր չէ, մինչդեռ փաստաթղթում եղած սխալն ունի հասցե, և դրա ուղղումը բարելավում է հետագա բոլոր հարցումները։ Հեղինակի կարծիքով՝ հնարավոր է, որ մոդելի քարտերում ինչ-որ պահի այլևս չնշեն գիտելիքի սահմանաչափը։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։