
Esse: LLM dövründə izahsız uğursuzluqlar normal hala gəlir
ihatethefuture.com bloqunda dərc olunan esse iddia edir ki, LLM-lə sürətlənən inkişaf mədəniyyəti "bəzən sadəcə pisdir" fikrini araşdırmaların qəbul edilən son nöqtəsinə çevirir.
ihatethefuture.com bloqunda dərc olunan esse (müəllifin təxəllüsü: patrickxia) Hacker News zirvəsinə çıxdı. Müəllif iddia edir ki, LLM-lə sürətlənən proqram təminatı mədəniyyəti heç kimin izah etməyə çalışmadığı uğursuzluqları tədricən normal hala gətirir.
"Stupid thing sucks"
Mətn cizgi filminin iki kadrı ilə başlayır: personaj açılmayan qapıdan keçməyə çalışır. Maneə tamamilə konkretdir: əvvəlcə yolda bir insan cəsədi, sonra təxminən bir milyard dollar dəyərində qızıl var. Hər iki səhnədə əsəbiləşmiş personaj "stupid thing sucks" (təxminən "axmaq şeydir, sadəcə pisdir") deyə mızıldanıb yoluna davam edir. Müəllif bunu "qapıların ağlabatan modeli" saymır: uğursuzluğun konkret səbəbi var idi, günah isə yanlış obyektin üzərinə düşdü.
Jev və "AI-powered" işarəsi
Sonra esse Jev-dən bəhs edir: TypeSafe AI tərəfindən hazırlanmış model tipə salınmış dəyərləri ehtimal qiymətləndirmələri ilə birlikdə qaytarır. Müəllif onun üstünlüklərini sürət və ucuzluq kimi təsvir edir: model sürətli, ucuzdur və onun üzərində tez qurmaq olar. Əsas sual qurmadan sonra başlayır. Müəllifin təsvirinə görə, alıcılar demək olar ki, qiymətləndirmə (eval) keçirmirlər: qeyri-şəffaf sualları Jev-ə verib qeyri-şəffaf cavablar alır, bununla da "AI-powered" işarəsini qoya bilirlər. Aşağı səviyyədə məntiq sındıqda "yaxşı da, AI səhv edir" izahı hazır olur; səhv büdcələri, uğursuzluq rejimləri və test dəstləri isə sonraya saxlanılır. Uğursuzluq nisbətini bu arada istifadəçilər özləri kəşf edir.
Esse açıq müdafiəni əvvəlcədən cavablandırır: Jev etimad balları qaytarır. Bəs onlarla nə edəcəksiniz? Etimad balına əsaslanaraq ağlabatan qərar vermək üçün həm balın kalibrlənməsini bilmək, həm də qeyri-müəyyənliyin nəyə başa gəldiyinə dair modelə sahib olmaq lazımdır. Müəllifin sözlərinə görə, insanlar etimad ballarını ən yaxşı halda "kargo kultu" tərzində istifadə edir, ən pis halda isə uğursuz sorğunun bəhanəsi edir: sanki "73% əminəm" cavabı sizə 27% səhv büdcəsi ayırıbmış kimi.
Məsuliyyət və araşdırmanın bitdiyi yer
Saytda düymə sındıqda mühəndisin adətən baş verənlərə dair modeli olur: müqavilə pozulub, DNS sıradan çıxıb, kimsə yalnız bir yolda sintaksis səhvləri olan skript buraxıb, işləyici gözlənilməz istisna atıb. Adi HTTP 500-ü ayıqlamaq imkanı olmaya bilər, amma son nöqtənin niyə işləmədiyini anlamaq kiminsə işidir. Lakin bir çox istifadəçi üçün real təcrübə buna yaxın deyil: "bəzən sadəcə pisdir".
Essenin əsas qorxusu LLM yönümlü inkişafın daha çox uğursuzluq yaratması deyil. Yaradacaq, artıq yaradıb: bu, yeni üsulla qurmağın qiymətinin bir hissəsidir. Qorxu odur ki, "bəzən sadəcə pisdir" ifadəsi getdikcə araşdırmanın qəbul edilən son nöqtəsinə çevrilir. Müəllif bunu itki sayır, çünki sürətlənmiş iş bu problemləri həll etməyə də kömək edə bilər: avtomatik QA iş axınları mühəndis vaxtı olmadığı üçün yazılmır, Jev-i əvəz edəcək və ya onun istifadəsini əsaslandıracaq qiymətləndirmə isə "bir neçə prompt aralığındadır". Esse metaforu ilə yekunlaşır: elə sistemlər qururuq ki, nə istifadəçi, nə də qurucu qapının arxasında cəsədin olub-olmadığını yoxlamağa maraq göstərir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.