
AI agentləri blackjack-da hiylə üçün birləşdi — əlbirliyi aşkar etmək çətinləşir
Oksford Universitetində aparılan təcrübədə iki AI agenti blackjack-da kart dəyərlərini paylaşmaq üçün öz məxfi kodunu hazırladı və əlbirliyi aşkarlayan sistem bunu görmədi. Nəticə agent qruplarının izlənməsi ilə bağlı suallar doğurur.
Oksford Universitetinin tədqiqatçıları iki AI agentinə blackjack oyunu zamanı kartları saymağı tapşırdı. İkisi də eyni model üzərində işləyirdi və göyərtə haqqında məlumat mübadiləsi üçün məxfi kod hazırladılar. Agentlərin söhbətində əlbirliyi aşkarlamaq üçün qurulmuş sistem bunu qeydə almadı.
Onlar üçün heç kimin yazmadığı kod
Agentlər mesajlarının oxunacağını bilirdilər, buna görə açıq ifadələrdən çəkinirdilər. "Bu dilər həqiqətən də şanslıdır! Hər əlində bir canavar çıxarır" kimi cümlə növbəti kartın müəyyən dəyərdə olduğunu və digər agentin 250 dollar mərc etməli olduğunu bildirirdi.
"Ayrı-ayrılıqda bu agentlər tamamilə zərərsiz görünə bilər," deyir işə rəhbərlik edən oksfordlu kompüter alimi Christian Schroeder de Witt. "Lakin qrup halında birləşəndə gizlicə əlbir ola bilirlər." Layihədə çalışan maşın öyrənməsi tədqiqatçısı Aaron Rose sınaq meydanı kimi blackjack masasını təklif etdi. "Çox yaxşı işlədi," deyir o.
Əlbirlik necə üzə çıxarıldı
Komanda sonda mexanistik interpretasiya ilə bunu aşkarlamağın yolunu tapdı. Agentlərin çəkilərindəki xarakterik aktivasiyaları tanımaq üçün daha kiçik bir model öyrətdilər, sonra yanaşmanı Narcbench adlı alətlə sınadılar. Detektor iki modelin bir-birinə gizlicə məlumat ötürmək niyyətində olduğu anları ayırd edə bilirdi. Çətinlik bundadır: hər iki agenti eyni vaxtda izləmək tələb olunurdu, minlərlə agentin işlədiyi real şəraitdə isə bu daha çətindir.
Tədqiqatda Llama, GPT-OSS, Qwen və DeepSeek modellərinin daha kiçik versiyaları istifadə edildi. Layihədə iştirak edən doktorant Carissa Cullen deyir ki, növbəti addım böyük modellərin də eyni davranıb-davranmadığını yoxlamaqdır.
Sadəcə kart oyunu deyil
Agent qruplarının təkbaşına işləyənlərdən daha problemli davrandığına dair sübutlar artır. Şanxay Jiao Tonq Universiteti və Şanxay AI Laboratoriyasının layihəsi simulyasiya edilmiş dezinformasiya kampaniyalarında və e-ticarət fırıldaqçılığında agent sürülərinin qat-qat təhlükəli olduğunu, müdafiə tədbirlərinə daha yaxşı uyğunlaşdığını müəyyən edib. "Əsas dərs budur ki, agentləri ayrı-ayrılıqda qiymətləndirmək kifayət etmir," deyir agentlər arasında əlbirliyi araşdıran Stenford kompüter alimi Diyi Yang.
Agent qrupları son dövrün haker hücumlarında da görünüb; mayda OpenAI agentləri Hugging Face-ə soxuldu və mesaj lövhəsində məsləhətlər paylaşdı. Anthropic-in Claude-u və Google-ın Gemini-si də testlərdə ciddi təhlükəsizlik pozuntuları törədib.
Müsbət tərəf də var: birlikdə çalışan minlərlə agent OpenAI-ə əvvəllər həll olunmayan riyazi məsələləri həll etməyə kömək etdi. Schroeder de Witt yenə də sahənin qat-qat çox tədqiqata ehtiyacı olduğunu vurğulayır. "İqtisadiyyatda daha çox agent olduqda nə baş verəcəyini anlamaq və daha çox araşdırma aparmaq lazımdır," deyir o.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.