Մեծ Բրիտանիայի AI Անվտանգության Ինստիտուտ. Ստանդարտ Թեստերը Համակարգված Կերպով Թերագնահատում են AI Գործակալների Իրական Հնարավորությունները
UK AISI-ի հետազոտությունը 7 թեստերի վրա ցույց է տալիս. ֆիքսված հաշվարկային բյուջեն էականորեն թերագնահատում է AI գործակալների իրական կարողությունները — տոկենների սահմանի 10-ապատիկ ավելացումը հաջողությունը բարձրացրեց ~25%-ով:
🔍 Ինչու ստանդարտ թեստերը չեն կարողանում չափել AI գործակալների իրական հզորությունը
Մեծ Բրիտանիայի AI Անվտանգության Ինստիտուտը (UK AISI) հրապարակել է հետազոտություն, որը դարձել է AI գնահատման ոլորտի ամենակարևոր հայտնագործություններից մեկը: Ինստիտուտը առաջատար AI մոդելները փորձարկել է յոթ տարբեր թեստերով և պարզել, որ ստանդարտ թեստերը համակարգված կերպով թերագնահատում են AI գործակալների կարողությունները:
Պատճառը պարզ է. յուրաքանչյուր թեստ ունի ֆիքսված հաշվարկային բյուջե՝ AI գործակալի կողմից օգտագործվող տոկենների առավելագույն քանակ: AISI-ի հետազոտողներն ապացուցել են, որ AI գործակալի կատարողականը ֆիքսված կետ չէ, այլ կոր, որն աճում է թեստային հաշվարկի զուգահեռ: Երբ բյուջեն կտրում ենք, մինչ այս կորը դեռ աճում է, ստացված միավորը ցույց է տալիս նվազագույնը, ոչ թե առավելագույնը: