Geri qayıt
AI artıq çap dövrə lövhəsi layihələndirə bilirmi? EEBench nəyi ölçür
SiTech AI Team2 წთ. საკითხავი

AI artıq çap dövrə lövhəsi layihələndirə bilirmi? EEBench nəyi ölçür

OpenAI GPT-6 Astra-nın KiCad-də lövhə üzərində işlədiyi demonu dərc edib. atopile komandasının açıq benchmarkı EEBench dizaynları real komponentlər və ən pis tolerantlıqlarla simulyasiyada qiymətləndirir.

OpenAI GPT-6 Astra-nın təqdimat yazısının əsas səhifəsində modelin KiCad-də çap dövrə lövhəsi üzərində işlədiyi demonu yerləşdirib. Elektronikanın böyük bir model buraxılışında bu qədər önə çıxması nadir haldır və demo atopile komandasının uzun müddətdir verdiyi sualı yenidən gündəmə gətirir: süni intellektin istehsal etdiyi elektronikanın həqiqətən yaxşı olub-olmadığını necə ölçmək olar?

Bu suala EEBench cavab axtarır — atopile komandasının qurduğu və maliyyələşdirdiyi, elektronika dizaynı üçün açıq benchmark. Komandanın müşahidəsinə görə, mövcud modellər elektronika haqqında ənənəvi CAD alətlərindəki nəticələrinin göstərdiyindən qat-qat çox bilir: onlar dərslikləri, məlumat vərəqlərini və application note-ları oxuyublar.

Agent GUI-də deyil, deklarativ kodda işləyir

Qrafik CAD alətini idarə edən agent vaxtının böyük hissəsini klikləməyə və ekranı izləməyə sərf edir; kontekstini koordinatlar, menular və tətbiqin vəziyyəti doldurur. EEBench bunun əvəzinə atopile-dan istifadə edir: dövrə deklarativ kodda yaşayır, ona görə də agent birbaşa komponentlər, birləşmələr və elektrik məhdudiyyətləri üzərində işləyir, dizaynı dəyişə, onu qura, simulyasiya işlədə və nəyin uğursuz olduğunu layihədən çıxmadan görə bilir. Komandanın sözlərinə görə, bu, modeldən GUI-də xətt çəkməyi xahiş etməkdən qat-qat yaxşı işləyir.

Real dünya qarışıqdır

Açıq tapşırıqlardan biri ev elektrik sayğacına əsaslanır. Onun 5 V təchizatı itəndə dövrə prosessoru daha 20 millisaniyə sağ saxlamalıdır ki, yığılmış göstəricini yadda saxlasın, qorunan xətt isə bu müddətdə prosessorun 3,0 V brownout həddindən yuxarı qalmalıdır. Modellərin çoxu intuitiv olaraq düzgün nəticəyə gəlir: kondensator əlavə etmək. Amma real kondensator işi çətinləşdirir: keramika hissə üzərinə gərginlik gələndə elan edilən tutumdan qat-qat az verə bilər, hissələrin tolerantlıqları var, daha çox tutum isə baha başa gəlir və güc qayıdanda xəttin bərpasını ləngidir. Dərc olunmuş nümunədə qorunan xətt 4,55 voltdan düşür və 3 volt həddini tələb olunan 20 ms yerinə 0,85 ms-də keçir.

Deterministik qiymətləndirmə və lider cədvəli

Yoxlamalar tamamilə deterministikdir: sistem təqdim edilən dizaynı qurur, dövrə qrafını və komponent siyahısını yaradır və SPICE simulyasiyalarını işlədir; hər tələb bir hədlə birlikdə ölçmə doğurur. Texniki bal istinad komponent siyahısına qarşı məsrəf səmərəliliyi ilə birləşdirilir və məsrəf yalnız dövrə işlədikdən sonra nəzərə alınır.

1 sentyabr nəticələrinə görə Claude Opus 5 EEBench V1-in 13 tapşırığında 61,6% ilə liderdir; onu 57,1% ilə Grok 4.6 və 56,4% ilə Claude Fable 5.1 izləyir. xAI Grok 4.6 model kartında EEBench-i mühəndisliyin sürətləndirilməsi bölməsində qeyd edib; özünün dərc etdiyi buraxılışda model yüksək düşünmə səyi ilə 60,0%-ə çatıb. Sınaqdan keçirilmiş OpenAI modelləri daha aşağıdadır: GPT-5.5 — 42,3% və GPT-5.6 Sol — 39,4%. EEBench V1 modelin tam məhsulu yerləşdirib istehsal edib işə sala biləcəyini hələ yoxlamır.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.