Վերադառնալ
44% ARC-AGI-1-ում՝ 67 ցենտով․ 1,5 ժամում վարժեցված փոքր տրանսֆորմեր
SiTech AI Team2 წთ. საკითხავი

44% ARC-AGI-1-ում՝ 67 ցենտով․ 1,5 ժամում վարժեցված փոքր տրանսֆորմեր

Միթիլ Վակդեն մեկ RTX 5090-ի վրա զրոյից վարժեցրել է փոքր տրանսֆորմեր, որը ARC-AGI-1-ի հրապարակային գնահատման մեջ 44% է ցույց տալիս։ Ամբողջ հաշվողական ծախսը՝ 67 ցենտ։

Հետազոտող Միթիլ Վակդեն հրապարակել է ARC-AGI-ի մասին իր շարքի երրորդ գրառումը։ Այս անգամ նա զրոյից վարժեցրել է փոքր տրանսֆորմեր, որը ARC-AGI-1-ի հրապարակային գնահատման հավաքածուում ցույց է տալիս 44%, իսկ ARC-AGI-2-ում՝ 7%։ Հեղինակի խոսքով՝ ամբողջ կյանքի ցիկլի հաշվողական ծախսը՝ ինիցիալիզացիայից սկսած ուսուցումը գումարած բոլոր առաջադրանքների ինֆերենսը, կազմել է 67 ցենտ։

Ուսուցումը տևում է մոտ 1,5 ժամ մեկ RTX 5090 քարտի վրա, և արդյունքը համընկնում է TRM-ի ու HRM-ի հրապարակած ցուցանիշների հետ․ Վակդեն ընդգծում է, որ այժմ համեմատվում է միայն նմանատիպ՝ թեստի ընթացքում ուսուցում օգտագործող մոտեցումների հետ։ Կոդը բաց է։

Ինչպես է աշխատում մոտեցումը

Հանելուկի յուրաքանչյուր մուտք-ելք զույգ վերածվում է թոքենների հաջորդականության, և փոքր տրանսֆորմերը զրոյից ավտոռեգրեսիվ կերպով սովորում է այդ հաջորդականությունների վրա հենց թեստի պահին՝ բենչմարքի հանելուկների վրա, ընդ որում թեստի ճիշտ պատասխանները թաքցված են։ Առաջադրանքների միջև գիտելիքի փոխանցման համար յուրաքանչյուր հանելուկ ստանում է իր սեփական սովորած ադիտիվ էմբեդինգը, իսկ դիրքային տեղեկությունը մշակվում է 3D RoPE էմբեդինգներով, քանի որ ամեն հաջորդականություն երկու 2D ցանց է պարունակում։

Ուսուցման տվյալները հարստացվում են գույնի և դիհեդրալ փոխարկումներով։ Ինֆերենսի ժամանակ թեստային մուտքերը նույնպես հարստացվում են, ստացված պատասխանների վրա կիրառվում է հակադարձ փոխակերպումը, և վերջում ներկայացվում են երկու ամենահաճախ հանդիպող պատասխանները։

Ինչ փոխվեց նախորդ տարբերակի համեմատ

Միավորի ամենամեծ աճը տվել է արդիականացված ճարտարապետությունը՝ GELU-ի փոխարեն SwiGLU և LayerNorm-ի փոխարեն RMSNorm, ինչպես նաև առավել բազմազան ու ավելի լավ խառնված տվյալները և 4 շերտից 8 շերտի անցումը։ Ծախսերը նվազել են քիչ աուգմենտացիաների, AdamW-ից NorMuon-ին (օժանդակ AdamW-ով) օպտիմիզատորի անցման և փոփոխական երկարության փաթեթավորված հաջորդականությունների վրա flash attention-ի շնորհիվ։

Ինչու է դա կարևոր

Վակդեն նմուշային արդյունավետությունը (sample efficiency) համարում է արհեստական բանականության ամենակարևոր չլուծված խնդիրը, իսկ ARC-ն՝ այն ստուգելու հարմար հարթակ․ մոտ 1000 հանելուկ, ամեն մեկը՝ իր կանոնով, և նվազագույն նախապայմաններ։ Նրա նպատակը այսօրվա խորը ուսուցման մեթոդների սահմանները պարզելն է և կրկնությունների ծախսն այնքան ցածր պահելը, որ աշխարհում ցանկացած մարդ կարողանա աշխատել այս խնդրի վրա։

Աբլյացիաների վերլուծությունը ցույց է տվել, որ արդյունավետության զգալի մասը պահպանվում է նաև առանց աուգմենտացիաների ու սինթետիկ տվյալների, իսկ մի քանի գործարկումների լուծած առաջադրանքների միավորումը հասնում է 55%-ի։ Հեղինակն այժմ կարծում է, որ 65%-ը հասանելի է սովորական տրանսֆորմերի շրջանակում, իսկ ծախսերի ևս տասնապատիկ կրճատումը հնարավոր է ձեռքով գրված GPU միջուկներով։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։