
האם ה-AI כבר יודע לתכנן מעגלים מודפסים? מה מודד EEBench
OpenAI הציגה הדגמה שבה GPT-6 Astra עובד על מעגל מודפס ב-KiCad. הבנצ'מרק הציבורי EEBench מצוות atopile מדרג תכנוני מעגלים בסימולציה עם רכיבים אמיתיים וסבילויות גרועות.
OpenAI הציבה בעמוד הראשי של הפוסט שהציג את GPT-6 Astra הדגמה שבה המודל עובד על מעגל מודפס ב-KiCad. אלקטרוניקה כמעט לא מופיעה כך בהשקות של מודלים גדולים, וההדגמה מחזירה שאלה שמעסיקה את צוות atopile כבר זמן מה: איך מודדים אם האלקטרוניקה שמודל מייצר היא באמת טובה?
לכך מיועד EEBench — בנצ'מרק ציבורי לתכנון אלקטרוניקה שנבנה וממומן על ידי צוות atopile. לפי הצוות, המודלים הנוכחיים יודעים על אלקטרוניקה הרבה יותר ממה שהפלט שלהם בכלי CAD רגילים מראה: הם קראו ספרי לימוד, דפי נתונים ו-application notes.
סוכן שעובד בקוד דקלרטיבי, לא בממשק גרפי
סוכן שמפעיל כלי CAD גרפי מבזבז זמן רב על קליקים ועל מעקב אחרי המסך, כשקואורדינטות, תפריטים ומצב האפליקציה ממלאים את ההקשר שלו. EEBench משתמש במקום זה ב-atopile: המעגל חי בקוד דקלרטיבי, כך שהסוכן עובד ישירות עם רכיבים, חיבורים ואילוצים חשמליים, ויכול לשנות תכנון, לבנות אותו, להריץ סימולציה ולבדוק מה נכשל בלי לצאת מהפרויקט. לדברי הצוות, זה טוב בהרבה מבקשה ממודל לצייר קווים בממשק גרפי.
העולם האמיתי מסובך
אחת המשימות הציבוריות מבוססת על מונה חשמל ביתי. כשאספקת 5 הוולט נעלמת, המעגל חייב לשמור על המעבד חי עוד 20 מילישניות כדי לשמור את הקריאה המצטברת, והמסילה המוגנת צריכה להישאר מעל סף ה-brownout של 3.0 וולט של המעבד לאורך כל החלון. רוב המודלים מגיעים מיד למסקנה הנכונה: להוסיף קבל. אבל קבל אמיתי מקשה את המשימה: רכיב קרמי עלול לספק קיבול קטן בהרבה מהמוצהר כשמופעל עליו מתח, לרכיבים יש סבילויות, וקיבול גדול יותר עולה יותר ומאט את התאוששות המסילה כשהחשמל חוזר. בדוגמה שפורסמה המסילה המוגנת יורדת מ-4.55 וולט וחוצה את סף 3 וולט אחרי 0.85 מילישניות — במקום 20 המילישניות הנדרשות.
ניקוד דטרמיניסטי וטבלת המובילים
הבדיקות דטרמיניסטיות לחלוטין: המערכת בונה את התכנון שהוגש, יוצרת את גרף המעגל ואת רשימת הרכיבים ומריצה סימולציות SPICE, וכל דרישה מייצרת מדידה עם גבול. הציון הטכני משולב ביעילות עלות מול רשימת רכיבים ייחוסית, ועלות נספרת רק אחרי שהמעגל עובד.
בתוצאות מ-1 בספטמבר Claude Opus 5 מוביל עם 61.6% ב-13 המשימות של EEBench V1, אחריו Grok 4.6 עם 57.1% ו-Claude Fable 5.1 עם 56.4%. xAI ציינה את EEBench בכרטיס המודל של Grok 4.6 בפרק על האצת הנדסה, ובהרצה שפרסמה הגיע המודל ל-60.0% במאמץ חשיבה גבוה. המודלים של OpenAI שנבדקו נמוכים יותר: GPT-5.5 עם 42.3% ו-GPT-5.6 Sol עם 39.4%. EEBench V1 עדיין לא בודק אם המודל יכול לפרוס, לייצר ולהעלות מוצר שלם.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.