
GPT-6 Astra מזהה טעויות בהרכבת רהיטי IKEA בדיוק של 80%
לפי Epoch AI, המודל GPT-6 Astra של OpenAI מאתר טעויות שהוחדרו בכוונה בתמונות של הרכבת רהיטי IKEA בדיוק של 80%, לעומת 28% בלבד שהיו התוצאה הטובה ביותר בנובמבר 2025.
המודל GPT-6 Astra של OpenAI מאתר כעת את רוב הטעויות שאנשים עושים בזמן הרכבת רהיטי IKEA. הוא מגיע לדיוק של 80% במדד Furniture Assembly Benchmark (FAB) של Epoch AI, שאותו פרסם מכון המחקר ב-23 בספטמבר. בנובמבר 2025 עמדה התוצאה הטובה ביותר על 28% והייתה שייכת ל-Claude Opus 4.5 של Anthropic.
המדד שואל שאלה צרה אך מעשית: האם המודל מצליח לקשר הוראות הרכבה מודפסות לחפץ אמיתי ולהסביר מה נעשה לא נכון? עבור Epoch AI זהו מדד לחשיבה חזותית ומרחבית.
מה בודק המדד
Epoch AI רכשה שלושה רהיטים של IKEA, שנבחרו לפי IKEA Complexity Index: מעמד נעליים STÄLL, מסגרת מיטה TONSTAD ושידת מגירות GULLABERG. החוקרים צילמו אותם בזמן ההרכבה והחדירו בכוונה טעויות מציאותיות, ולעיתים המשיכו להרכיב אחרי הטעות כדי להקשות על זיהויה.
המודל מקבל 60 תמונות, חלקן של הרכבה תקינה וחלקן עם טעויות, ובנוסף את ההוראות, כלי זום ומפרש Python בתקציב של 80 צעדים בסביבת סוכן. כדי לזכות בנקודה על המודל לציין כל שלב שבו נעשתה טעות ולתאר אותה; את התיאור בודק GPT-5.6 Sol.
המתחרים והפער
Claude Fable 5.1 מגיע ל-70% ו-Claude Opus 5 ל-61%. המודלים הסיניים בקטגוריית המשקולות הפתוחות מפגרים אחרי החזית: Kimi K3 מפגר בשבעה חודשים ב-FAB, לעומת 4.4 חודשים במדד Capabilities Index הכללי של Epoch. לפי Epoch AI, תמיכה בתמונות עדיין נדירה במודלים סיניים: ל-DeepSeek V4 Pro, ל-DeepSeek Flash ול-GLM 5.3 של Z.ai אין אותה כלל.
למה זה חשוב
הרכבת רהיטים משמשת את החוקרים כמידה מקורבת לעבודות תחזוקה שדורשות את אותם כישורים, למשל תיקון מכונית או מכשיר ביתי. Astra הוא גם המודל המהיר ביותר שנבחן: זמן חציוני של שלוש דקות לתמונה, פי שניים עד פי עשרה מהר יותר מהמובילים הקודמים, אך עדיין איטי מדי להנחיה בזמן אמת. המדד כולל רק 60 תמונות משלוש הרכבות, ולכן לא ברור עד כמה התוצאות מכלילות למשימות פיזיות אחרות.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.