რატომ ვრჩები სკეპტიკურად LLM-ების მიმართ ნავიე-სტოქსის შემდეგაც
ბლოგზე გამოქვეყნებული განხილული მასალა ამტკიცებს, რომ AI-ის სენსაციური შედეგები რეალურ ავტონომიას არ ნიშნავს: მოდელებს კვლავ მკაცრი ზედამხედველობა სჭირდებათ, ხოლო მკაცრი სპეციფიკაციის ღირებულება ფირმების უმეტესობისთვის სტრუქტურული ბარიერია.
ჰაიპის წინააღმდეგ
15 სექტემბერს ბლოგ dank.systems-ზე გამოქვეყნებული მასალა ამტკიცებს, რომ დიდი ენობრივი მოდელების (LLM) გარშემო აჟიოტაჟი იმაზე წინაა, ვიდრე სისტემებს რეალურად შეუძლიათ. ავტორის თქმით, წამყვანი ლაბორატორიების შეფასება ეფუძნება ნარატივს, თითქოს ისინი უახლოეს მომავალში შექმნიან „მუშა ძალის უმეტესი ნაწილის სრულად ავტომატიზებულ, უპირობო ჩამნაცვლებელს“, მაშინ როცა არსებულ მოდელებს „ყველაზე მარტივ ამოცანებშიც კი“ შრომატევადი ზედამხედველობა და შემზღუდველი წესები სჭირდებათ.
სათაურებში მოხვედრილი დემონსტრაციები — ნავიე-სტოქსის ნაშრომი, FreeBSD-ის დისტანციური კოდის შესრულების აღმოჩენები და Hugging Face-ის ინციდენტი — ავტორის აზრით, მნიშვნელოვანი ავტონომიის მიღწევას არ ადასტურებს; ის მიუთითებს პროგრამულ კომპანიებზე, რომლებიც კვლავ ასაქმებენ ინჟინრებს, რომლებიც დღევანდელ ბენჩმარკებზე დაბლა დააფასებდნენ იმ მოდელებზე, რომლებიც მათ ზედამხედველობენ.
ვიწრო განზოგადება და სპეციფიკაციის ფასი
მეორე მტკიცება განზოგადებას ეხება: მოდელები კარგად მუშაობენ მხოლოდ იმ ამოცანების მცირე სიახლოვეში, რომლებზეც გაწვრთნილი იყვნენ, და იქაც „მცირე გადახრა დაფარული კლასის შიგნით იწვევს სრულ მარცხს ან ჯილდოს გატეხვას“. ამის გამოსწორება საჭიროებს დარგის ექსპერტის მიერ შედგენილ მკაცრ სპეციფიკაციას, რომლის დროც ძვირია — და თავად სპეციფიცირება ცალკე უნარია, ამიტომ, ავტორის აზრით, იმ ადამიანების წრე, ვინც დარგს იცის და ერთდროულად ზუსტად სპეციფიცირებაც იცის, ძალიან მცირეა.
აპარატურულ ინჟინერიაში ტიპურ CPU-ის პროექტს დაახლოებით სამჯერ მეტი სპეციფიკაციისა და ვალიდაციის ინჟინერი ჰყავს, ვიდრე დიზაინის ინჟინერი, ხოლო 5:1-ის თანაფარდობა იშვიათი არ არის, აღნიშნავს პოსტი.
მათემატიკა — საუკეთესო შემთხვევა, ადამიანური შემოწმება — სარეზერვო ვარიანტი
მათემატიკური შედეგები, ავტორის სიტყვებით, „აბსოლუტურად საუკეთესო სცენარია“ მკაცრი სპეციფიკაციის პირობებში მუშაობისთვის: თეორემის ფორმულირება უკვე სპეციფიკაციაა, ის ათწლეულების განმავლობაში მათემატიკური საზოგადოების მიერაა გადამოწმებული, ხოლო Lean-ში მისი ფორმალიზაცია mathlib-ის გამოცდილი ობიექტების თარგმანია. მიუხედავად ამისა, სისწორის ხარვეზებმა ადრე LLM-ებს საშუალება მისცა, ყალბი მტკიცებულებები Lean-ის ბირთვში გაეტარებინათ.
ალტერნატივა — ადამიანური გადამოწმება — ვერ ფარავს მოდელის გამომუშავებულ მოცულობას და თავადაც დაუცველია მანიპულაციის მიმართ; ავტორი მაგალითად მოიხსენიებს xz-ის უკანა კარს და Linux-ის ბირთვში „თვალთმაქცური კომიტების“ ინციდენტს. თუ ადამიანური გადამოწმება ციკლში რჩება, წარმოების ტემპი ადამიანის ყურადღებით შემოიფარგლება.
რომელ ფირმებს შეუძლიათ ავტონომიური AI
პოსტის დასკვნით, დომენების უმეტესობაში LLM-ები „გატეხილი სტაჟიორის“ მსგავსია — „სწრაფი და ეფექტური ზრდასრულის ხელში, მაგრამ არა ის, ვისაც საქმის მართვა ენდობა“. სრულად ავტონომიური გამოყენება მხოლოდ სამ ტიპის ფირმას შეუძლია: ისინი, ვინც მარცხს იაფად იტანს (მაგალითად, სწრაფი პროტოტიპირების გუნდები); ისინი, ვისაც ვიწრო და კარგად შემოსაზღვრული ამოცანები აქვს (კონტროლირებადი განმეორებადი სამუშაო, მომხმარებელთა მომსახურების ჩატი); და ისინი, ვინც მკაცრი სპეციფიკაციისა და ვალიდაციის ხარჯს უკვე იხდის (ჩიპების დიზაინი, წამლების აღმოჩენა).
პირველი ორი ჯგუფი ფასის მიმართ მგრძნობიარეა და, ავტორის აზრით, მათ საკმარისია ღია მოდელები იაფ აპარატურაზე. მისი დასკვნაა, რომ შედეგები წამყვანი ლაბორატორიების საზღვრებს სცდება.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.