
Google-ის მკვლევარები თვითგაუმჯობესებადი AI-აგენტების მიერ ტესტების დამახსოვრებას ებრძვიან
Google Cloud AI Research-მა და უნივერსიტეტებმა წარადგინეს RRSI, მეთოდი, რომელიც არეგულირებს, როგორ გადაწერენ AI-აგენტები საკუთარ harness-ებს, ხელს უშლის ტესტების დამახსოვრებას და ტოკენების ხარჯს დაახლოებით 30%-ით ამცირებს.
Google Cloud AI Research-მა და რამდენიმე უნივერსიტეტმა გამოაქვეყნეს ნაშრომი, რომელშიც აღწერილია მეთოდი, რომელიც თვითგაუმჯობესებად AI-აგენტებს ტესტური ამოცანების დამახსოვრებისგან იცავს და გამოთვლით ხარჯებსაც ამცირებს. მიდგომას RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) ჰქვია და ის მიმართულია არა თავად მოდელზე, არამედ ენობრივი მოდელის გარშემო არსებულ პროგრამულ ფენაზე.
თვითოპტიმიზაცია დამახსოვრებამდე მიჰყავს
თანამედროვე AI-აგენტები ფიქსირებულ ენობრივ მოდელს harness-ში ახვევენ, რაც პრომპტების, სამუშაო პროცესების, ხელსაწყოების, მეხსიერებისა და ლოგიკის ჩარჩოა და აკონტროლებს, რას ხედავს მოდელი ყოველ ნაბიჯზე. ნაშრომის მიხედვით, აგენტებში ბოლო დროის პროგრესის დიდი ნაწილი სწორედ harness-ზე მუშაობით იქნა მიღწეული და არა ახალი მოდელებით. უფრო ახალი მეთოდები ამ ციკლს ავტომატიზებენ და ენობრივ მოდელს აძლევენ საშუალებას, თავად გადაწეროს harness ტესტური ამოცანებიდან მიღებული უკუკავშირის საფუძველზე, რაც რეკურსიული თვითგაუმჯობესების პრაქტიკული ფორმაა.
მკვლევარებმა ერთი ხარვეზი აღმოაჩინეს. რადგან აგენტი ერთსა და იმავე შეზღუდულ ტესტურ ამოცანებზე მუშაობს, საბოლოოდ ისინი ზეპირად ისწავლება. სავარჯიშო ამოცანებზე ქულები იზრდება, ახალ, უნახავ ამოცანებზე მიღწეული წინსვლა კი მცირდება ან საერთოდ ქრება. ძიება იმახსოვრებს მხოლოდ ერთ ბენჩმარკზე მორგებულ შაბლონებს, უპირატესობას შემთხვევით კარგი ქულის მქონე კანდიდატებს ანიჭებს და არასაჭირო სირთულეს ამატებს, რაც ტესტის ქულებს ზრდის, თუმცა აგენტს უკეთესს არ ხდის.
მცირე ბიუჯეტები და მკაცრი კრიტიკოსი
RRSI ოპტიმიზაციის ციკლის ორივე მხარეს მუშაობს და harness-ს სრულად რედაქტირებადს ტოვებს. ბიუჯეტი ზღუდავს, რამდენი დამოუკიდებელი ცვლილება შეიძლება კანდიდატმა ერთდროულად გააერთიანოს, და ეს ბიუჯეტი დროთა განმავლობაში მცირდება. ადრეული რაუნდები უფრო დიდ გადაწერას იძლევა, გვიანი რაუნდები კი მხოლოდ მცირე ცვლილებებს, რომლებიც შედეგთან ნათლად დაკავშირებადია. სისტემა თვალს ადევნებს ადრინდელ მცდელობებს, რომ ერთი და იმავე წარუმატებელი იდეების კვალდაკვალ სვლა აირიდოს, წინსვლის შეჩერებისას კი განზრახ ექსპერიმენტებს ატარებს harness-ის ხელუხლებელ ნაწილებზე.
ცვლილებების შერჩევისას კრიტიკოსი ყველა წინადადებას განიხილავს და უარყოფს ყველას, რომელიც ამოცანების სახელებს, ამონახსნებს ან ბენჩმარკზე მორგებულ სხვა ხრიკებს პირდაპირ ამაგრებს. სხვა წესი უფრო მაღალ გამოთვლით ხარჯს მხოლოდ გაზომვადი შედეგის მატების შემთხვევაში იღებს, უკვე უსარგებლო კომპონენტები კი ამოღება ხდება.
ზრდა უნახავ ამოცანებზე
გუნდმა RRSI რვა ბენჩმარკზე გამოსცადა, რომლებიც პროგრამირებას, აგენტურ საოფისე საქმესა და საინჟინრო დიზაინს მოიცავს; Claude Opus 4.8 მთელი ტესტირების განმავლობაში გაყინული იყო. RRSI-მ სავარჯიშო ამოცანებზე 14,1 ქულამდე მოიპოვა, ხუთ უნახავ ბენჩმარკზე კი 4,7 ქულამდე, ამავდროულად გაშვების დროს ტოკენების დაახლოებით 30%-ით ნაკლები ხარჯი დასჭირდა, ვიდრე არარეგულირებულ ვერსიას. საერთო შედეგი არც ერთ უნახავ ბენჩმარკზე საბაზისო დონეზე არ დაცემულა, ხოლო ყველაზე დიდი, 4,7-ქულიანი მატება JobBench-ზე დაფიქსირდა.
შედარებული ყველა მეთოდი სავარჯიშო ამოცანებზე კარგად მუშაობდა, თუმცა ახლებზე შედეგები შეიცვალა და ორი მეთოდი საბაზისო harness-ზე დაბლა აღმოჩნდა. RRSI-მ ყველა ვარიანტს შორის ყველაზე მცირე მატება აჩვენა სავარჯიშო ამოცანებზე და ერთადერთი მეთოდი იყო, რომელიც უნახავ ამოცანებზე საბაზისო დონეს შესამჩნევად აღემატებოდა.
Gemini 3.5 Flash-ით ოპტიმიზებულმა პროგრამირების harness-მა ბევრად სუსტი Gemini 3.1 Flash Lite-ის სიზუსტე ცვლილებების გარეშე 11,2-დან 14,6 ქულამდე აწია, რაც იმაზე მიუთითებს, რომ აღმოჩენილი მექანიზმები დამოკიდებული არ არის იმ მოდელის შესაძლებლობებზე, რომელიც მათ საპოვნელად გამოიყენეს. ავტორები აღნიშნავენ, რომ კვლევა მხოლოდ გაყინული მოდელების გარშემო არსებულ harness-ებს მოიცავს და მოდელის წონების ცვლილებას არ განიხილავს. კოდი GitHub-ზეა ხელმისაწვდომი.
მონათესავე ნაშრომები
ხელით შექმნილი harness-ები ხშირად ვერ განზოგადდება. ARC-AGI-3-ზე ჩატარებულმა ტესტებმა აჩვენა, რომ Opus 4.6 ნაცნობ გარემოში 97,1% აგროვებდა, უცხო გარემოში კი, სპეციალურად შექმნილი harness-ით, 0%. Nvidia-მ ცოტა ხნის წინ წარადგინა SoL-Pi, სადაც კვლევითი აგენტი ავტომატურად აღადგენს პროგრამირების აგენტების harness-ს და ტოკენების ხარჯს 49%-მდე ამცირებს შესამჩნევი შედეგის დაცემის გარეშე. ცოტა ხნით ადრე Google-მა აგენტებს წარსული საძიებო სესიების სიზმრის ნახვა აიძულა, რათა მათი საძიებო სტრატეგია გაეუმჯობესებინათ, და მოდელიც უცვლელად დატოვა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.