უკან დაბრუნება
დიდი მოდელები აღარ არიან გამოსავალი: GPT-5.5-ის ჰალუცინაციები 86%-ია, GLM-5.2-ის — 28%
SiTech AI Team2 წთ. საკითხავი

დიდი მოდელები აღარ არიან გამოსავალი: GPT-5.5-ის ჰალუცინაციები 86%-ია, GLM-5.2-ის — 28%

arrowtsx.dev-ის ანალიზი აჩვენებს, რომ პარამეტრების რბოლამ ჭერს მიაღწია: MIT ლიცენზიის ღია მოდელი GLM-5.2 ბენჩმარკებზე GPT-5.5-ს თითქმის დაეწია და სანდოობით მნიშვნელოვნად უსწრებს მას.

ხელოვნური ინტელექტის წამყვანი ლაბორატორიები სულ უფრო ეჭვით უყურებენ იმ ვარაუდს, რომ პარამეტრებისა და სავარჯიშო მონაცემების უსასრულო ზრდა ავტომატურად უკეთეს მოდელებს იძლევა. arrowtsx.dev-ზე 18 ივნისს გამოქვეყნებულ ანალიზში ავტორი ამტკიცებს, რომ მასშტაბირებამ ჭერს მიაღწია, დიდი ზომა კი ახლა სხვა პრობლემას უკავშირდება — მოდელებს, რომლებიც საკუთარ უცოდინარობას არ აღიარებენ.

ბენჩმარკები და პარამეტრების რბოლა

ტექსტი უჩვეულო მაგალითით იწყება: Claude Fable 5-ზე წვდომა აშშ-ის მთავრობამ გამოშვებიდან სამ დღეში შეზღუდა — პოსტის მიხედვით, ეს ეროვნული უსაფრთხოების გამო დაწესებული პირველი ამერიკული აკრძალვაა, რომლის მიზეზიც ერთი ჯეილბრეიკის რისკი გახდა. ამავდროულად, Z.ai-ის ღია წონების მოდელი GLM-5.2 (753 მილიარდი პარამეტრი, აქტიური დაახლოებით 40 მილიარდი) Artificial Analysis Intelligence Index-ზე GPT-5.5-ს მხოლოდ 4 ქულით, Fable 5-ს კი 9 ქულით ჩამორჩება. Opus 4.8 და GPT-5.5 დახურული მოდელებია, რომლებიც კონსერვატიული შეფასებით 1–2 ტრილიონ პარამეტრს მოიცავს. თუ MIT ლიცენზიის ღია მოდელი ასე უახლოვდება ერთნახევარ-ორჯერ უფრო დიდ დახურულ მოდელს, ავტორის დასკვნით, ინტელექტის ზრდა პრაქტიკულად გაჩერდა.

ჰალუცინაციების მაჩვენებლები

ანალიზის მეორე ნაწილი სანდოობას ეხება. AA-Omniscience ბენჩმარკზე DeepSeek V4 Pro (1.6 ტრილიონი პარამეტრი, 49 მილიარდი აქტიური) 94%-იან ჰალუცინაციის მაჩვენებელს აჩვენებს: იმ შემთხვევებში, როცა პასუხი არ იცოდა, მან ეს მხოლოდ დაახლოებით 6%-ში აღიარა. GLM-5.2-ის მაჩვენებელი 28%, Opus 4.8-ის 36%, Fable 5-ის 48%, GPT-5.5-ის კი 86% არის. უზარმაზარ ფაქტობრივ მონაცემებზე გაწვრთნილი მოდელები, ავტორის აზრით, სწავლობენ, რომ ყოველთვის გასცენ პასუხი და არა თქვან „არ ვიცი".

ტესტი და გადაუჭრელი ტრილემა

ამის საილუსტრაციოდ ორივე მოდელს მისცეს რთული Python-ის ამოცანა აშკარა არქიტექტურული ხარვეზით — მაღალი reasoning effort-ითა და temperature 1-ზე, OpenRouter-ის გავლით. DeepSeek V4 Pro-მ თითქმის ათჯერ მეტი მსჯელობის ტოკენი დახარჯა და მაინც თავდაჯერებულად არასწორი პასუხი გასცა. GLM-5.2-ს დაახლოებით 12 წამი და 800 ტოკენი დასჭირდა იმის გასაცნობიერებლად, რომ ერთნაკადიანი ამოცანა მულტიპლექსირებულ I/O-ს ვერ შეასრულებს კონტროლის დათმობის გარეშე. ცალკე ცდაში DeepSeek V4 Pro-მ 3 წუთი და 26 წამი დახარჯა მსჯელობის ციკლში, რომ შემდეგ კარგად ფორმატირებული, მაგრამ არასწორი გადაწყვეტა წარმოედგინა.

ავტორის დასკვნაა, რომ მოდელების გაწვრთნა და შერჩევა გადაუჭრელი ტრილემის ირგვლივ უნდა აშენდეს: ნედლი შესაძლებლობები, გაურკვევლობის კალიბრაცია და გამოთვლითი ეფექტურობა. მხოლოდ ზომით ან ლიდერბორდზე ადგილით მოდელის არჩევა, პოსტის გაფრთხილებით, სულ უფრო ხშირად ნიშნავს სისტემის არჩევას, რომელიც დამაჯერებლად დაიცავს უბრალოდ არასწორ პასუხს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.