
Unreal Labs-მა წარადგინა Unreal Agent — ასინქრონული harness 40%-მდე ხარჯის დაზოგვით
Unreal Labs-მა გამოაქვეყნა დეტალები Unreal Agent-ის შესახებ — harness, რომელიც tool-გამოძახებებს სრულად ასინქრონულად მართავს. Terminal-Bench 4.0-ზე ის Codex-ის შედეგს იმეორებს, თან გაცილებით ნაკლები ხარჯით.
Unreal Labs-მა გამოაქვეყნა დეტალები Unreal Agent-ის შესახებ — აგენტის harness, რომლის მთავარი დიზაინის გადაწყვეტილება ის არის, რომ tool-გამოძახებები მთლიანად ასინქრონულად იმართება და მოდელს აღარ უწევს ლოდინი, polling ან heartbeat-ების გაგზავნა. კომპანიის მტკიცებით, მიმდინარე ვერსია ხარჯებს 40%-მდე ამცირებს Codex-თან და 20%-მდე Pi-სთან შედარებით, რეალურ დატვირთვებსა და აგენტურ ბენჩმარკებზე.
harness შეიქმნა პრაქტიკული პრობლემის გადასაჭრელად: აგენტები დროისა და ტოკენების დიდ ნაწილს tool-გამოძახებების მართვაზე ხარჯავენ და არა სასარგებლო სამუშაოზე. დიზაინი ასევე საშუალებას იძლევა, აგენტი ნებისმიერ მომენტში მართო მიმდინარე გამოძახების დასრულების მოლოდინის გარეშე.
ასინქრონული tool-გამოძახების runtime
ყოველ ჯერზე, როცა Unreal Agent tool-ს იძახებს, ის დაუყოვნებლივ წერს event-log ჩანაწერს, რომ tool დაბრუნდა „მიმდინარე“ სტატუსით, და აგრძელებს მის შესრულებას ფონზე. როცა tool რეალურად სრულდება, შედეგი ემატება სესიის ლოგს და შემდეგ ხდება მოდელის გამოძახება. კომპანია აღნიშნავს, რომ ორი tool-შედეგის პატერნი — ერთი მიმდინარე და ერთი საბოლოო — Responses API-ის დოკუმენტაციაში ჯერ საკმარისად არ არის განსაზღვრული.
შედეგები ბენჩმარკებზე
GPT-6 Astra-სთან xhigh reasoning effort რეჟიმში ტესტირებისას Unreal Agent-მა Terminal-Bench 4.0-ზე Codex-ის ლიდერბორდის საბაზისო შედეგი გაიმეორა — 57.9% წარმატება, თან 1428 დოლარით 2350-ის ნაცვლად. SWE-Atlas Codebase QnA-ზე მან 65.8% და 936 დოლარი აჩვენა, Codex-ის 63.3%-ისა და 1303 დოლარის წინააღმდეგ. DeepSWE 1.1-ზე შედეგი 72.4% და 1367 დოლარია, Codex-ის 69.0% და 1633 დოლარის ფონზე. ALE-CLI ნაკრებზე Unreal Agent-მა 30.0% სრული გავლა და 59.7 საშუალო ქულა მიიღო 217 დოლარად, Codex-ის 29.0% და 58.1 ქულის წინააღმდეგ 292 დოლარად. Unreal Labs მცირე სხვაობას ბენჩმარკის ვარიაციით ხსნის და აღნიშნავს, რომ harness დომენისგან დამოუკიდებელია.
რატომ არ გამოიყენეს არსებული SDK
პოსტში ნათქვამია, რომ agent-first პროდუქტის აწყობის ერთადერთი სწორი გზა არ არსებობს. CLI-ზე ორიენტირებული SDK-ები, მაგალითად Claude-ის Agent SDK, ვარაუდობენ ლოკალურ სესიებს, ქვეპროცესებსა და რესურსების ლიმიტებს, რომლებიც პროდაქშენში პირდაპირ არ გადადის და გუნდს საკუთარი lifecycle-მართვის აწყობას ტოვებს. რამდენიმე პროვაიდერის მხარდაჭერა დამატებით თავსებადობის სამუშაოს მოითხოვს: API რეჟიმის შეცვლამ შეიძლება tool-ები ან compaction გააფუჭოს, SDK-ის განახლებამ კი შეტყობინებების ფორმატი შეცვალოს. harness hook-ებით დანერგილი დადასტურებები მეტ მოვლას საჭიროებს, ვიდრე დეტერმინისტული sandbox შეზღუდვები.
ამიტომ Unreal Agent მცირეა: მარტივი prompt-ები, ტოკენებზე ოპტიმიზებული tool-შედეგები, subagent-ებისა და workflow-ების გარეშე. SDK მოიცავს Go ბიბლიოთეკას, claude -p-ის მსგავს runner-ს და Harbor-თან თავსებად benchmark runner-ს; კოდი GitHub-ზეა.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.