Назад
Чи вміє ШІ проєктувати плати? Що показує бенчмарк EEBench
SiTech AI Team3 წთ. საკითხავი

Чи вміє ШІ проєктувати плати? Що показує бенчмарк EEBench

OpenAI показала GPT-6 Astra за роботою над платою в KiCad. Публічний бенчмарк EEBench від команди atopile оцінює схеми в симуляції з реальними компонентами та найгіршими допусками.

OpenAI розмістила на першій сторінці анонсу GPT-6 Astra демонстрацію того, як модель працює над друкованою платою в KiCad. Електроніка рідко потрапляє на перший план у релізах великих моделей — і це повертає питання, яке команда atopile ставить собі вже давно: як виміряти, чи справді хороша електроніка, яку створює ШІ?

Відповідь намагається дати EEBench — публічний бенчмарк для проєктування електроніки, який будує й фінансує команда atopile. За їхніми спостереженнями, сучасні моделі знають про електроніку значно більше, ніж показують результати їхньої роботи у звичайних CAD-інструментах: вони читали підручники, даташити й application notes.

Агент працює з декларативним кодом, а не в GUI

Агент, який керує графічним CAD-інструментом, витрачає багато часу на клікання й відстеження того, що на екрані: його контекст заповнюють координати, меню та стан застосунку. Натомість EEBench використовує atopile: схема живе в декларативному коді, тож агент працює безпосередньо з компонентами, з'єднаннями та електричними обмеженнями, може змінити дизайн, зібрати його, запустити симуляцію й подивитися, що саме не спрацювало, не виходячи з проєкту. За словами команди, це працює значно краще, ніж просити модель малювати лінії в GUI.

Реальний світ непростий

Одне з публічних завдань побудоване на побутовому лічильнику електроенергії. Коли його 5-вольтове живлення зникає, схема має утримувати процесор живим ще 20 мс, щоб зберегти накопичені показники, а захищена шина весь цей час повинна залишатися вище порогу brownout у 3,0 В. Більшість моделей інтуїтивно доходять правильного висновку: додати конденсатор. Але справжній конденсатор робить завдання складнішим. Керамічний компонент під напругою може давати значно меншу ємність, ніж заявлено, деталі мають допуски, а більша ємність коштує дорожче і сповільнює відновлення шини після повернення живлення. В опублікованому прикладі захищена шина падає з 4,55 В і перетинає поріг 3 В через 0,85 мс — замість потрібних 20 мс.

Детерміноване оцінювання та лідерборд

Перевірки повністю детерміновані: система збирає поданий дизайн, будує граф схеми та специфікацію компонентів і запускає SPICE-симуляції; кожна вимога дає вимірювання з лімітом. Технічний бал поєднується з економічністю щодо еталонної специфікації, і вартість зараховується лише тоді, коли схема вже працює.

У результатах від 1 вересня Claude Opus 5 очолює таблицю з 61,6% на 13 завданнях EEBench V1, далі йдуть Grok 4.6 — 57,1% і Claude Fable 5.1 — 56,4%. xAI згадала EEBench у картці моделі Grok 4.6 у розділі про прискорення інженерії, а її власний опублікований запуск дав 60,0% за високих зусиль міркування. Протестовані моделі OpenAI розташувалися нижче: GPT-5.5 — 42,3%, GPT-5.6 Sol — 39,4%. EEBench V1 поки не перевіряє, чи здатна модель розвести, виготовити й запустити повний продукт.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.