Geri Dön
Unreal Labs, %40'a kadar tasarruf sağlayan asenkron Unreal Agent'ı tanıttı
SiTech AI Team2 წთ. საკითხავი

Unreal Labs, %40'a kadar tasarruf sağlayan asenkron Unreal Agent'ı tanıttı

Unreal Labs, araç çağrılarını tamamen asenkron yöneten Unreal Agent harness'ının ayrıntılarını yayımladı. Ajan, Terminal-Bench 4.0'da Codex'in sonucunu çok daha düşük maliyetle yakalıyor.

Unreal Labs, Unreal Agent'ın ayrıntılarını yayımladı: Temel tasarım kararı, araç çağrılarının tamamen asenkron yönetilmesi ve böylece modelin bir araç için beklemek, yoklamak ya da heartbeat göndermek zorunda kalmaması. Şirkete göre mevcut sürüm, gerçek iş yüklerinde ve ajan benchmarklarında maliyeti Codex'e kıyasla %40'a kadar, Pi'ye kıyasla %20'ye kadar azaltıyor.

Harness pratik bir sorundan doğdu: Ajanlar zamanlarının ve tokenlarının büyük bölümünü yararlı iş yapmak yerine araç çağrılarını yönetmeye harcıyordu. Tasarım ayrıca süren bir araç çağrısını beklemeden ajanı her an yönlendirmeye izin veriyor.

Asenkron araç çağrısı altyapısı

Unreal Agent bir aracı her çağırdığında, olay günlüğüne aracın "sürüyor" durumunda döndüğüne dair bir kayıt ekliyor ve aracı arka planda çalıştırmaya devam ediyor. Araç gerçekten bittiğinde sonuç oturum günlüğüne yazılıyor ve ardından model çağrısı yapılıyor. Şirket, iki sonuçlu çağrı kalıbının — biri süren, biri nihai — Responses API belgelerinde henüz yeterince tanımlanmadığını belirtiyor.

Kodlama ajanları için kalite-maliyet eğrisi

Benchmark sonuçları

GPT-6 Astra ile xhigh akıl yürütme düzeyinde test edilen Unreal Agent, Terminal-Bench 4.0'da Codex'in liderlik tablosu temel çizgisini %57,9 başarı oranıyla yakaladı ve 2.350 dolara karşı 1.428 dolar maliyetle çalıştı. SWE-Atlas Codebase QnA'da 936 dolara %65,8 alırken Codex 1.303 dolara %63,3'te kaldı. DeepSWE 1.1'de sonuç 1.367 dolara %72,4, Codex ise 1.633 dolara %69,0. ALE-CLI setinde Unreal Agent 217 dolara %30,0 tam geçme ve 59,7 ortalama skor elde etti; Codex 292 dolara %29,0 ve 58,1'de kaldı. Unreal Labs küçük farkı benchmark varyansına bağlıyor ve harnessın alandan bağımsız olduğunu belirtiyor.

Neden mevcut bir SDK değil

Yazıya göre ajan öncelikli bir ürün geliştirmenin tek doğru yolu yok. Claude'un Agent SDK'sı gibi CLI odaklı SDK'lar yerel oturumlar, alt süreçler ve kaynak sınırları varsayıyor; bunlar üretime doğrudan taşınmıyor ve ekipler tamamlama, iptal ve arka plan görevleri için kendi yaşam döngüsü yönetimini kurmak zorunda kalıyor. Birden çok sağlayıcı desteği uyumluluk işi ekliyor: API modunu değiştirmek araçları veya sıkıştırmayı bozabiliyor, SDK güncellemeleri mesaj biçimlerini değiştirebiliyor. harness hook'larıyla uygulanan onaylar ise deterministik sandbox kısıtlarından daha fazla bakım gerektiriyor.

Bu yüzden Unreal Agent küçük tutuluyor: basit promptlar, token açısından optimize edilmiş araç sonuçları, alt ajan ya da iş akışı yok. SDK bir Go kütüphanesi, claude -p benzeri bir çalıştırıcı ve Harbor uyumlu bir benchmark çalıştırıcısı sunuyor; kod GitHub'da.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.