Böyük Britaniyanın AI Təhlükəsizliyi İnstitutu: Standart Benchmark-lar AI Agentlərinin Real İmkanlarını Sistematik Şəkildə Aşağı Qiymətləndirir
UK AISI-nin 7 benchmark üzrə araşdırması göstərir: sabit hesablama büdcəsi AI agentlərinin real imkanlarını əhəmiyyətli dərəcədə aşağı qiymətləndirir — token limitinin 10 dəfə artırılması uğur nisbətini ~25% yüksəltdi.
🔍 Niyə Benchmark-lar AI Agentlərinin Real Gücünü Ölçə Bilmir?
Böyük Britaniyanın AI Təhlükəsizliyi İnstitutu (UK AISI) AI qiymətləndirmə sahəsində ən əhəmiyyətli kəşflərdən birinə çevrilən bir araşdırma dərc etdi. İnstitut aparıcı AI modellərini yeddi fərqli benchmark-da sınaqdan keçirdi və müəyyən etdi ki, standart testlər AI agentlərinin qabiliyyətlərini sistematik şəkildə düzgün qiymətləndirmir.
Səbəb sadədir: hər bir benchmark-ın sabit hesablama büdcəsi var — AI agentinin istifadə edə biləcəyi maksimum token sayı. AISI tədqiqatçıları sübut etdilər ki, AI agentinin performansı sabit nöqtə deyil, test-time hesablama ilə artan əyridir. Büdcəni bu əyri hələ yüksələrkən kəsdikdə, nəticə minimumu göstərir, maksimumu deyil.