Վերադառնալ
SiTech Team⏱️ 1 წთ. საკითხავი

Մեծ Բրիտանիայի AI Անվտանգության Ինստիտուտ. Ստանդարտ Թեստերը Համակարգված Կերպով Թերագնահատում են AI Գործակալների Իրական Հնարավորությունները

Մեծ Բրիտանիայի AI Անվտանգության Ինստիտուտ. Ստանդարտ Թեստերը Համակարգված Կերպով Թերագնահատում են AI Գործակալների Իրական Հնարավորությունները

UK AISI-ի հետազոտությունը 7 թեստերի վրա ցույց է տալիս. ֆիքսված հաշվարկային բյուջեն էականորեն թերագնահատում է AI գործակալների իրական կարողությունները — տոկենների սահմանի 10-ապատիկ ավելացումը հաջողությունը բարձրացրեց ~25%-ով:

🔍 Ինչու ստանդարտ թեստերը չեն կարողանում չափել AI գործակալների իրական հզորությունը

Մեծ Բրիտանիայի AI Անվտանգության Ինստիտուտը (UK AISI) հրապարակել է հետազոտություն, որը դարձել է AI գնահատման ոլորտի ամենակարևոր հայտնագործություններից մեկը: Ինստիտուտը առաջատար AI մոդելները փորձարկել է յոթ տարբեր թեստերով և պարզել, որ ստանդարտ թեստերը համակարգված կերպով թերագնահատում են AI գործակալների կարողությունները:

Պատճառը պարզ է. յուրաքանչյուր թեստ ունի ֆիքսված հաշվարկային բյուջե՝ AI գործակալի կողմից օգտագործվող տոկենների առավելագույն քանակ: AISI-ի հետազոտողներն ապացուցել են, որ AI գործակալի կատարողականը ֆիքսված կետ չէ, այլ կոր, որն աճում է թեստային հաշվարկի զուգահեռ: Երբ բյուջեն կտրում ենք, մինչ այս կորը դեռ աճում է, ստացված միավորը ցույց է տալիս նվազագույնը, ոչ թե առավելագույնը:

📖 Կարդացեք ամբողջական հոդվածը The Decoder-ում