Niyə GPT və Claude Bridgewater-ın Maliyyə Testlərində Uğursuz Oldu — Düzgün Cavablar Heç Vaxt İctimai Olmayıb
Bridgewater Associates və Thinking Machines Lab sübut etdi ki, GPT və Claude maliyyə sənədlərinin təhlilində ~50% dəqiqliyə malikdir — çünki düzgün cavablar onların ictimai təlim məlumatlarında heç vaxt olmayıb.
💰 GPT və Claude-nin Uğursuz Olduğu Test — Maliyyə Sənədlərində 50% Dəqiqlik
Bugünkü rəqabətli AI dünyasında hər gün eşidirik ki, böyük dil modelləri (LLMs) mürəkkəb problemləri — proqramlaşdırmadan riyaziyyata və hüquqa qədər — necə həll edir. Lakin GPT-4.1 və Claude Bridgewater Associates-in xüsusi maliyyə məlumat bazaları ilə qarşılaşdıqda nəticə sarsıdıcı oldu. Hər iki model təxminən 50% düzgün cavab verdi — bu, dəqiq cavablardan daha çox təsadüfi təxminə yaxın bir nəticədir.
Niyə dünyanın ən güclü iki modeli bu konkret tapşırıqda uğursuz oldu? Cavab sadə və təəccüblüdür: çünki düzgün cavablar ictimai təlim məlumatlarında heç vaxt olmayıb.