
Yapay zeka artık devre kartı tasarlayabiliyor mu? EEBench neleri ölçüyor
OpenAI, GPT-6 Astra'nın KiCad'de bir devre kartı üzerinde çalıştığı bir demo yayınladı. atopile ekibinin açık kıyaslaması EEBench, tasarımları gerçek bileşenler ve en kötü toleranslarla simülasyonda puanlıyor.
OpenAI, GPT-6 Astra'nın tanıtım yazısının ana sayfasına modelin KiCad'de bir devre kartı üzerinde çalıştığı bir demoyu koydu. Elektroniğin büyük bir model lansmanında bu kadar öne çıkması nadir ve demo, atopile ekibinin uzun süredir sorduğu soruyu yeniden gündeme getirdi: Bir yapay zekanın ürettiği elektroniğin gerçekten iyi olup olmadığını nasıl ölçeriz?
Bu soruya EEBench cevap arıyor: atopile ekibinin geliştirdiği ve finanse ettiği, elektronik tasarımı için açık bir kıyaslama. Ekibe göre mevcut modeller elektronik hakkında, geleneksel CAD araçlarındaki çıktılarının gösterdiğinden çok daha fazlasını biliyor; ders kitaplarını, veri sayfalarını ve uygulama notlarını okumuş durumdalar.
Ajan GUI'de değil, bildirimsel kodda çalışıyor
Grafiksel bir CAD aracını kullanan ajan, zamanının büyük bölümünü tıklamakla ve ekranda olup biteni takip etmekle geçiriyor; koordinatlar, menüler ve uygulama durumu bağlamını dolduruyor. EEBench bunun yerine atopile kullanıyor: Devre bildirimsel kodda yaşıyor, böylece ajan doğrudan bileşenler, bağlantılar ve elektriksel kısıtlar üzerinde çalışabiliyor; tasarımı değiştirip kurabiliyor, simülasyon çalıştırıp neyin başarısız olduğunu projeden çıkmadan görebiliyor. Ekibe göre bu, bir modelden GUI'de çizgi çizmesini istemekten çok daha iyi çalışıyor.
Gerçek dünya karmaşık
Kamuya açık görevlerden biri ev tipi bir elektrik sayacına dayanıyor. 5 V besleme kaybolduğunda devre, biriken değeri kaydedebilmek için işlemciyi 20 ms daha hayatta tutmak zorunda ve korunan hat bu süre boyunca işlemcinin 3,0 V'luk brownout eşiğinin üzerinde kalmalı. Modellerin çoğu sezgisel olarak doğru sonuca varıyor: bir kondansatör eklemek. Ama gerçek bir kondansatör işi zorlaştırıyor: Seramik bir parça, üzerine gerilim geldiğinde vaat edilen kapasitenin çok altını verebiliyor, parçaların toleransları var ve daha fazla kapasite daha pahalı olup güç geri geldiğinde hattın toparlanmasını yavaşlatıyor. Yayımlanan örnekte korunan hat 4,55 volttan düşüyor ve 3 volt eşiğini gereken 20 ms yerine 0,85 ms'de geçiyor.
Deterministik puanlama ve liderlik tablosu
Kontroller tamamen deterministik: Sistem gönderilen tasarımı kuruyor, devre grafiğini ve malzeme listesini oluşturuyor ve SPICE simülasyonları çalıştırıyor; her gereksinim bir sınırla birlikte bir ölçüm üretiyor. Teknik puan, referans malzeme listesine karşı maliyet verimliliğiyle birleştiriliyor ve maliyet ancak devre çalıştıktan sonra fayda sağlıyor.
1 Eylül sonuçlarında Claude Opus 5, EEBench V1'deki 13 görevde %61,6 ile lider; onu %57,1 ile Grok 4.6 ve %56,4 ile Claude Fable 5.1 izliyor. xAI, EEBench'e Grok 4.6 model kartında mühendislik hızlandırma bölümünde yer verdi; kendi yayımladığı koşuda model yüksek akıl yürütme çabasıyla %60,0'a ulaştı. Test edilen OpenAI modelleri daha aşağıda: GPT-5.5 %42,3 ve GPT-5.6 Sol %39,4. EEBench V1, bir modelin eksiksiz bir ürünü yerleştirip üretip devreye alıp alamayacağını henüz test etmiyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.