
Google tədqiqatçıları özünü təkmilləşdirən AI agentlərin testləri əzbərləməsinin qarşısını alır
Google Cloud AI Research və universitetlər RRSI-ni təqdim ediblər. Bu metod AI agentlərin öz harness-lərini necə yenidən yazmasını tənzimləyir, testlərin əzbərlənməsinin qarşısını alır və token xərclərini təxminən 30% azaldır.
Google Cloud AI Research və bir neçə universitet RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) metodunu təqdim edib. Metod özünü təkmilləşdirən AI agentlərin testləri əzbərləməsini dayandırır və hesablama xərclərini azaldır. Yanaşma modelə deyil, dil modelinin ətrafındakı proqram qatına yönəlib.
Özünü optimallaşdırma əzbərləməyə aparır
AI agentləri sabit dil modelini harness içinə bükür; bu, promptlar, iş axınları, alətlər, yaddaş və məntiq çərçivəsidir. Məqaləyə görə, son tərəqqi əsasən harness üzərində işləməklə əldə edilib. Yeni metodlar modelə testlərdən alınan əks əlaqə ilə harness-i yenidən yazmağa imkan verir.
Tədqiqatçılar çatışmazlıq tapıblar: agent eyni məhdud testləri əzbər öyrənir. Məşq tapşırıqlarında ballar artır, yeni tapşırıqlarda irəliləyiş azalır və ya yox olur. Axtarış yalnız bir benchmark-a uyğun şablonları yadda saxlayır və lazımsız mürəkkəblik əlavə edir; bu, test ballarını artırır, amma agenti yaxşılaşdırmır.
Kiçik büdcələr və sərt tənqidçi
RRSI optimallaşdırma dövrünün hər iki tərəfində işləyir və harness-i tam redaktə edilə bilən saxlayır. Büdcə namizədin eyni vaxtda birləşdirə biləcəyi müstəqil dəyişiklikləri məhdudlaşdırır və zamanla azalır. Erkən raundlar böyük yenidən yazmağa, gec raundlar isə kiçik dəyişikliklərə imkan verir. Sistem uğursuz ideyaları təkrarlamamaq üçün əvvəlki cəhdləri izləyir; irəliləyiş dayandıqda toxunulmamış hissələrdə eksperimentlər aparır.
Tənqidçi tapşırıq adlarını, həlləri və ya benchmark-a uyğun hiylələri birbaşa bərkidən təklifləri rədd edir. Daha yüksək hesablama xərci yalnız ölçülə bilən nəticə artımı olduqda qəbul edilir; faydasız komponentlər çıxarılır.
Görülməmiş tapşırıqlar üzrə artım
Komanda RRSI-ni proqramlaşdırma, ofis işləri və mühəndis dizaynını əhatə edən səkkiz benchmark-da sınayıb; Claude Opus 4.8 dondurulmuşdu. RRSI məşq tapşırıqlarında 14,1 bala, beş görülməmiş benchmark-da 4,7 bala çatıb; tənzimlənməmiş versiyadan təxminən 30% az token xərcləyib. Heç bir görülməmiş benchmark-da baza səviyyəsindən aşağı düşməyib; ən böyük artım JobBench-də olub.
Bütün müqayisə olunan metodlar məşq tapşırıqlarında yaxşı işləyirdi, lakin yenilərində iki metod baza harness-dən aşağı düşdü. RRSI məşq tapşırıqlarında ən kiçik artımı göstərdi və görülməmiş tapşırıqlarda baza səviyyəsini aşan yeganə metod oldu.
Gemini 3.5 Flash ilə optimallaşdırılmış proqramlaşdırma harness-i daha zəif Gemini 3.1 Flash Lite dəqiqliyini dəyişiklik etmədən 11,2 baldan 14,6 bala qaldırıb. Bu, mexanizmlərin onları tapmaq üçün istifadə olunan modelin imkanlarından asılı olmadığını göstərir. Tədqiqat yalnız dondurulmuş modellərin ətrafındakı harness-ləri əhatə edir və model çəkilərinin dəyişməsinə baxmır. Kod GitHub-da əlçatandır.
Əlaqəli tədqiqatlar
Əl ilə hazırlanmış harness-lər çox vaxt ümumiləşmir. ARC-AGI-3 testlərində Opus 4.6 tanış mühitdə 97,1%, yad mühitdə xüsusi harness ilə 0% toplayırdı. Nvidia yaxınlarda SoL-Pi-ni təqdim edib; tədqiqat agenti proqramlaşdırma agentlərinin harness-ini avtomatik bərpa edir və nəticə düşmədən token xərclərini 49%-ə qədər azaldır. Google agentlərə keçmiş axtarış sessiyalarını yuxuda görməyi əmr edib ki, strategiyalarını yaxşılaşdırsınlar; model dəyişməz qalıb.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.