Վերադառնալ
GPT-6 Astra-ն IKEA-ի կահույքի հավաքման սխալները գտնում է 80% ճշգրտությամբ
SiTech AI Team2 წთ. საკითხავი

GPT-6 Astra-ն IKEA-ի կահույքի հավաքման սխալները գտնում է 80% ճշգրտությամբ

Epoch AI-ի տվյալներով՝ OpenAI-ի GPT-6 Astra-ն IKEA-ի կահույքի հավաքման լուսանկարներում դիտավորյալ սխալները հայտնաբերում է 80% ճշգրտությամբ, մինչդեռ 2025-ի նոյեմբերին լավագույն արդյունքը 28% էր։

OpenAI-ի GPT-6 Astra մոդելն այժմ գտնում է IKEA-ի կահույքի հավաքման ժամանակ մարդկանց թույլ տված սխալների մեծ մասը։ Epoch AI-ի Furniture Assembly Benchmark (FAB) թեստում այն հասնում է 80% ճշգրտության. հետազոտական խումբը արդյունքները հրապարակել է սեպտեմբերի 23-ին։ 2025-ի նոյեմբերին լավագույն արդյունքը 28% էր՝ Anthropic-ի Claude Opus 4.5-ինը։

Թեստը նեղ, բայց գործնական հարց է դնում. կարո՞ղ է մոդելը կապել թղթային հրահանգը իրական առարկայի հետ և բացատրել, թե ինչ է արվել սխալ։ Epoch AI-ի համար սա տեսողական և տարածական մտածողության ցուցիչ է։

Մոդելների ճշգրտությունը Epoch AI-ի Furniture Assembly Benchmark-ում

Ինչ է ստուգում թեստը

Epoch AI-ն գնել է IKEA-ի երեք կահույք՝ ընտրված IKEA Complexity Index-ով. կոշիկի դարակ STÄLL, մահճակալի շրջանակ TONSTAD և վարտիք GULLABERG։ Հետազոտողները լուսանկարել են հավաքումը և դիտավորյալ իրատեսական սխալներ թույլ տվել. հաճախ շարունակել են հավաքել սխալից հետո, որպեսզի այն ավելի դժվար նկատելի լինի։

Մոդելը ստանում է 60 լուսանկար՝ մասը ճիշտ, մասը սխալ հավաքված կահույքի, ինչպես նաև հրահանգը, խոշորացման գործիք և Python-ի ինտերպրետատոր՝ 80 քայլանոց գործակալային բյուջեի սահմաններում։ Միավոր ստանալու համար մոդելը պետք է նշի սխալ պարունակող բոլոր քայլերը և նկարագրի սխալը. նկարագրությունը ստուգում է GPT-5.6 Sol-ը։

Դիտավորյալ սխալ հավաքված IKEA-ի կահույք

Մրցակիցները և բաց մոդելների հետամնացությունը

Claude Fable 5.1-ը հասնում է 70%-ի, Claude Opus 5-ը՝ 61%-ի։ Չինական բաց կշիռներով մոդելները հետ են մնում առաջատարներից. Kimi K3-ը FAB-ում յոթ ամսով հետ է, մինչդեռ Epoch-ի ընդհանուր Capabilities Index-ում այդ տարբերությունը 4,4 ամիս է։ Epoch AI-ի խոսքով՝ պատկերների աջակցությունը չինական մոդելներում դեռ հազվադեպ է. այն չունեն DeepSeek V4 Pro-ն, DeepSeek Flash-ը և Z.ai-ի GLM 5.3-ը։

Ինչու է դա կարևոր

Կահույքի հավաքումը հետազոտողների համար նույն հմտությունները պահանջող տեխնիկական աշխատանքի չափիչ է, օրինակ՝ մեքենայի կամ կենցաղային տեխնիկայի վերանորոգումը։ Astra-ն նաև թեստավորված ամենաարագ մոդելն է. լուսանկարի վրա միջինը երեք րոպե՝ երկուսից տաս անգամ ավելի արագ, քան նախորդ առաջատարները, սակայն իրական ժամանակում օգնության համար դեռ դանդաղ է։ Թեստն ընդգրկում է ընդամենը 60 լուսանկար երեք հավաքումից, ուստի պարզ չէ, թե արդյունքները որքանով են տարածվում այլ ֆիզիկական առաջադրանքների վրա։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։