რატომ ჩავარდნენ GPT და Claude Bridgewater-ის ფინანსურ ტესტებში — სწორი პასუხები საჯაროდ არასდროს გამოქვეყნებულა
Bridgewater Associates-მა და Thinking Machines Lab-მა დაამტკიცეს, რომ GPT-სა და Claude-ს ფინანსური დოკუმენტების ანალიზში 50%-იანი სიზუსტე აქვთ — მათ უბრალოდ არასდროს უნახავთ სწორი პასუხები.
💰 ტესტი, რომელშიც GPT-მა და Claude-მა ჩაიჭრნენ — 50% სიზუსტე ფინანსურ დოკუმენტებში
დღევანდელ კონკურენტულ AI-სამყაროში ყოველდღე გვესმის, როგორ ხსნის დიდი ენობრივი მოდელები (LLMs) კომპლექსურ პრობლემებს — კოდირებიდან მათემატიკამდე და სამართლამდე. მაგრამ როდესაც GPT-4.1 და Claude Bridgewater Associates-ის საკუთრივ ფინანსურ მონაცემთა ბაზებს შეხვდნენ, შედეგი შოკისმომგვრელი იყო. ორივე მოდელმა მხოლოდ 50% სწორი პასუხი აჩვენა — დონე, რომელიც უფრო შემთხვევით გამოცნობასთან ახლოსაა, ვიდრე ზუსტ ანალიზთან.
რატომ ჩაიჭრნენ მსოფლიოს ორი ყველაზე ძლიერი მოდელი სწორედ ამ დავალებაში? პასუხი მარტივი და გასაკვირია: იმიტომ, რომ სწორი პასუხები არასდროს ყოფილა საჯარო training data-ში. ეს არ არის ისტორია AI-ს შეზღუდვებზე — ეს არის ისტორია თავად ცოდნის ბუნებაზე.
🔬 ექსპერიმენტი: Bridgewater-მა როგორ შექმნა ფინანსური ტესტი
Bridgewater Associates, მსოფლიოს უდიდესი ჰეჯ-ფონდი $150 მილიარდზე მეტი აქტივებით, Thinking Machines Lab-თან პარტნიორობით უნიკალური ტესტი შექმნა. CFA ან FRM გამოცდების ნაცვლად, მათ Bridgewater-ის რეალური შიდა ფინანსური დოკუმენტები გამოიყენეს — მონაცემები, რომლებიც საჯაროდ არასდროს გამოქვეყნებულა. ტესტი მარტივი იყო: ორ წამყვან AI მოდელს — GPT-4.1-ს (OpenAI) და Claude-ს (Anthropic) — გადაეცათ ფინანსური დოკუმენტები და სთხოვეს ანალიზი.
📊 შედეგები: ~50% — ძლივს შემთხვევითობის დონეზე მაღლა
ორივე მოდელმა 50% სწორი პასუხი აჩვენა. Bridgewater-ის მკვლევარები იქ არ გაჩერებულან. "Expert prompting"-ის ტექნიკის გამოყენებით — კონკრეტული დომენის კონტექსტისა და მსჯელობის ჩარჩოების მიწოდებით — ქულა 75%-მდე გაიზარდა. მაგრამ ყველაზე საინტერესო შედეგი fine-tuning-მა მოგვცა. Qwen3-235B (ღია კოდის მოდელი) Bridgewater-ის მონაცემებზე fine-tuning-ით მიაღწია 84.7% სიზუსტეს — 14-ჯერ დაბალ ფასად, ვიდრე წამყვანი API-ზე დაფუძნებული მოდელები.
🧠 მთავარი აღმოჩენა: რა იციან LLM-ებმა სინამდვილეში
ეს ექსპერიმენტი ავლენს ფუნდამენტურ ჭეშმარიტებას: LLM-ებს არ შეუძლიათ შექმნან ცოდნა, რომელიც მათ training data-ში არ იყო. 50% Bridgewater-ის ტესტზე არ ნიშნავს, რომ მოდელები "ცუდები არიან ფინანსებში" — ეს ნიშნავს, რომ კონკრეტული ცოდნა, რომელიც სწორი პასუხისთვის იყო საჭირო, უბრალოდ საჯარო არ იყო.
ეს არის მთავარი განსხვავება: LLM-ებს აქვთ შესანიშნავი განზოგადების უნარი, მაგრამ მათ არ გააჩნიათ ნამდვილი გაგება. მოდელი, რომელიც CFA-ზე 95%-ს იღებს, მაინც ვერ უპასუხებს კითხვას ისეთ საკუთრივ ფინანსურ მოდელზე, რომელიც არასდროს უნახავს.
🇬🇪 რას ნიშნავს ეს ქართული ბიზნესისა და ფინანსებისთვის
საქართველოს ფინანსური სექტორისთვის — TBC Bank, Bank of Georgia, და მზარდი fintech ეკოსისტემა — ეს კვლევა კრიტიკულ გზავნილს შეიცავს. მზა AI მოდელები ვერასდროს მიაღწევენ იმ სიზუსტეს, რასაც თქვენს სპეციფიკურ მონაცემებზე fine-tuned მოდელი. 50% vs 84.7% განსხვავება AI-ს შეზღუდვა კი არა, ზოგადი მოდელების შეზღუდვაა. ფინანსური ინსტიტუტები, რომლებიც ჩადებენ ინვესტიციას fine-tuning-ში, მნიშვნელოვან კონკურენტულ უპირატესობას მოიპოვებენ.
14-ჯერ დაბალი ფასი განსაკუთრებით მნიშვნელოვანია Georgian SMEs-სა და startups-თვის. Open-source მოდელების fine-tuning-ი ბევრად იაფია, ვიდრე ძვირადღირებული API-ზე დაფუძნებული მოდელები — და უკეთეს შედეგსაც იძლევა.