Geri qayıt
Kod yazmaq üçün Astra: Armin Ronaxerin heç nə verməyən 35 saatlıq təcrübəsi
SiTech AI Team3 წთ. საკითხავი

Kod yazmaq üçün Astra: Armin Ronaxerin heç nə verməyən 35 saatlıq təcrübəsi

Proqram mühəndisi həftə sonu OpenAI-nin Astra modelinə özünüidarə edən „proqram fabriki“ işlətdirdi. Nəticə: 75 000 sətir kod, 79 commit və onun sözləri ilə desək, dəyərli heç nə.

Proqram mühəndisi Armin Ronaxer həftə sonu boyu OpenAI-nin Astra modeli üzərində qurulmuş özünüidarə edən „proqram fabriki“ işlədərək 35 saat keçirdi və təəssüratlarını 7 sentyabrda dərc etdi. Quruluş qəsdən nəzarətsiz idi: model öz kontekstini idarə edir, qeydlərini agent-notes qovluğunda saxlayır və bir məqsəd üçün alt agentlər başladırdı - virtual saplar və leksik skoplama ilə Python versiyası. Bunun üçün bir abunə sıfırlamasına bərabər token xərcləndi. 35 saatdan sonra fabrik, onun sözləri ilə, „tamamilə dəyərsiz heç nə“ istehsal etmədi.

Fabrik nə istehsal etdi

Təcrübə xalis olaraq təxminən 75 000 sətir kod və 79 commit əlavə etdi; agentlər arasında təxminən 1 400 mesaj mübadilə edildi, birbaşa API xərci isə təxminən 1 200 dollar oldu - hər commit üçün təqribən 15,50 dollar. Özü də CPython interpretatoru üzərində çalışan Ronaxer problemin təlim prosesində olduğunu düşünür: Astra uzunmüddətli tapşırıqları tamamladığı üçün böyük mükafat alır, lakin „pis kod“ üçün demək olar ki, cəza yoxdur. Nəticədə model 3D oyunlar yaratmaqda, avadanlığın tərs mühəndisliyində və tapşırıqları sona qədər aparmaqda həqiqətən təsir edicidir, amma onu əsl proqram mühəndisliyi üçün istifadə edə bilmir.

„Kod-qolfu“ alət çağırışları

İki vərdiş diqqət çəkir. Astra alət çağırışlarını mühitin edit və patch alətlərindən istifadə etmək əvəzinə həddindən artıq sıxılmış Python ilə ifadə etməyi xoşlayır - öz ifadəsi ilə „kod-qolfu“. Topladığı loglarda alt agentlər C mənbələrini Python sətir əməliyyatları ilə dəyişdirir, macOS-də fayl deskriptorlarının ötürülməsini yoxlamaq üçün birdəfəlik socket proqramları yazır və Windows maşınında clipboard kitabxanasını sınamaq üçün Bash-dən Python-a, oradan Node.js və PowerShell-ə zəncir qururlar.

Sonra bu üslub həqiqətən commit edilən koda sızır - xüsusilə testlərə və HTML-ə yerləşdirilmiş JavaScript və ya CSS-ə; model oralarda kod bazasından „bir addım uzaqda“ görünür. Ölçdüyü iki unit testi girintisiz, boşluqlara düşmən formasıyla ruff format-dan sonrakı halından 10% daha token-səmərəlidir. Digər nümunələr arasında Python-dan C-yə ötürülən sərt rəqəm sabitləri, istehsalat kodunda vəziyyəti saxlamaq üçün istifadə edilən təsadüfi indekslər və onlarla ardıcıl case budağı olan C funksiyası var.

Niyə „bunu niyə edirik“ sualını verir

Onun arqumenti imkanlar deyil, təşviqlər haqqındadır. Token səmərəliliyi və asanlıqla ölçülən digər xüsusiyyətlər lokal səviyyədə optimallaşdırıla bilər, lakin lokal yaxşılaşmalar qlobal optimum vermir və nəticəyə baxan insan sayı azaldıqca bunun əhəmiyyəti də azalır. Təcrübədə hətta tapşırıq adları 1, 2, 3, 5, 5a-dan 8b2c2b3 və „checkpoint“ variantlarına qədər pozuldu.

O, həmçinin modellərin hara getdiyini düşünür: əvvəlki nəsillər onu proqram mühəndisliyində yaxşı nöqtədə qoymuşdu. „Astra və Fable ilə xərclər astronomikdir və bu modellər sadəcə mənim üçün, bir proqram mühəndisi kimi, deyil“, deyə yazır və onların getdikcə daha çox hüquqşünaslar, 3D rəssamlar və riyaziyyatçılar üçün hazırlandığını ehtimal edir. İzah edə bilmədiyi bir şey var: sandbox-dakı modellər digər agentlər üçün qeyd qoymaq məqsədi ilə yenə də eyni açıq vikini tapırlar.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.