
„მოდელები განზრახ სულელდებიან“ — რატომ ცვლიან ლაბორატორიები ცოდნას მსჯელობაზე
ბლოგ-პოსტის ავტორი ამტკიცებს, რომ AI ლაბორატორიები განზრახ ცვლიან მსოფლიო ცოდნას მსჯელობის უნარზე: მოდელები მათემატიკასა და კოდში ძლიერდებიან, ფაქტების დამახსოვრებაში კი სუსტდებიან.
ბლოგ-პოსტში „Models Are Getting Dumber on Purpose“ ავტორი ამტკიცებს, რომ წამყვანი AI ლაბორატორიები განზრახ ცვლიან მსოფლიო ცოდნას მსჯელობის უნარზე: მოდელები უფრო ნაკლები გამოთვლით წყვეტენ მათემატიკისა და კოდის ამოცანებს, მაგრამ უარესად ახსოვთ ფაქტები.
ბენჩმარკები საპირისპირო მიმართულებით მიდიან
პოსტის მიხედვით, GLM-5.2 AIME 2026-ზე 99,2%-ს აღწევს დაახლოებით 40 მილიარდი აქტიური პარამეტრით თითო ტოკენზე, Qwen3.5 — 91,3%-ს 17 მილიარდით, DeepSeek V4-Flash კი 13 მილიარდით მუშაობს. შედარებისთვის, 2023 წელს GPT-4-ს დაახლოებით 280 მილიარდ აქტიურ პარამეტრს მიაწერდნენ, თუმცა ის AIME-ის ამოცანას ძლივს წყვეტდა. Qwen3.5 9B კვანტიზებული სახით 6 გბ VRAM-ში ეტევა და Artificial Analysis-ის ინდექსზე 10 მილიარდზე ნაკლები პარამეტრის მქონე მოდელების საუკეთესო შედეგს დაახლოებით ორჯერ აღემატება. ფაქტების ცოდნისას სურათი პირიქითაა: SimpleQA-ზე, სადაც ინსტრუმენტების გამოყენება აკრძალულია, ლიდერია Gemini 2.5 Pro 53%-ით, ხოლო Qwen3.5 4B და 9B მოდელების ჰალუცინაციის მაჩვენებელი 80–82%-ია.
ფაქტები ძველდება, პროცედურები — არა
ცოდნის მოცულობის კვლევები, მათ შორის „Physics of Language Models“, აფასებს, რომ ერთ პარამეტრზე დაახლოებით ორი ბიტი ფაქტობრივი ცოდნა მოდის. ავტორის თქმით, მსჯელობა უკეთ იკუმშება, რადგან ის მცირე რაოდენობის პროცედურების გამეორებაა: ამოცანის ნაწილებად დაყოფა, შუალედური მდგომარეობის თვალყურის დევნება, საკუთარი ნაბიჯების შემოწმება. Phi-4 14 მილიარდი პარამეტრის მოდელია, სინთეტიკურ მონაცემებზე გაწვრთნილი — ძლიერია მათემატიკაში და სუსტი ტრივიაში. ფაქტებს შენახვის ვადა აქვს, ალგებრას — არა.
სად ცხოვრობს ცოდნა ახლა
თუ მოდელი ფაქტებს აღარ ინახავს, მათ გარე გარემო აწვდის: ძებნა, ინსტრუმენტების გამოძახება, დოკუმენტაცია. კოდირების აგენტი დამოკიდებულების API-ს არ იზეპირებს — კითხულობს node_modules-ს ან დოკუმენტაციას. ავტორი ვარაუდობს, რომ რამდენიმე წელიწადში frontier-დონის მსჯელობა ერთ სამომხმარებლო GPU-ზე იმუშავებს: DeepSeek V4-Flash 13 მილიარდი აქტიური პარამეტრით მსჯელობს, დანარჩენი 271 მილიარდი კი ძირითადად ფაქტების საცავია ექსპერტთა შრეებში. წონებში ჩაწერილი არასწორი ფაქტი ვერსად საძიებელია, გარე დოკუმენტში მყოფს კი მისამართი აქვს — მისი გასწორება მომდევნო პასუხებსაც ასწორებს. ავტორის აზრით, შესაძლოა მოდელების ბარათებზე ცოდნის შეწყვეტის თარიღი საერთოდ გაქრეს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.