Чому GPT і Claude провалили фінансові тести Bridgewater — правильні відповіді ніколи не були публічними
Bridgewater Associates та Thinking Machines Lab довели, що GPT і Claude досягають лише ~50% точності в аналізі фінансових документів — тому що правильні відповіді ніколи не були в їхніх публічних тренувальних даних.
💰 Тест, у якому GPT і Claude провалилися — 50% точності на фінансових документах
У сучасному конкурентному світі ШІ ми щодня чуємо, як великі мовні моделі (LLM) вирішують складні проблеми — від програмування й математики до юриспруденції. Але коли GPT-4.1 і Claude зіткнулися з власними фінансовими базами даних Bridgewater Associates, результат був приголомшливим. Обидві моделі отримали лише близько 50% правильних відповідей — рівень, ближчий до випадкового вгадування, ніж до точного аналізу.
Чому дві найпотужніші моделі світу провалилися саме в цьому завданні? Відповідь проста й несподівана: тому що правильні відповіді ніколи не з'являлися в публічних тренувальних даних. Це не історія про обмеження ШІ — це історія про природу самого знання.