SiTech Team⏱️ 1 წთ. საკითხავი
لماذا فشل GPT وكلود في اختبارات Bridgewater المالية — الإجابات الصحيحة لم تكن عامة مطلقًا
أثبتت Bridgewater Associates وThinking Machines Lab أن GPT وClaude تحققان دقة ~50% فقط في تحليل المستندات المالية — لأن الإجابات الصحيحة لم تكن أبدًا في بيانات التدريب العامة الخاصة بهما.
💰 الاختبار الذي فشل فيه GPT وكلود — 50% دقة في تحليل المستندات المالية
في عالم الذكاء الاصطناعي التنافسي اليوم، نسمع يوميًا كيف تحل نماذج اللغة الكبيرة (LLMs) مشاكل معقدة — من البرمجة إلى الرياضيات وحتى القانون. ولكن عندما واجهت GPT-4.1 وClaude قواعد بيانات Bridgewater Associates المالية الخاصة، كانت النتيجة صادمة. حصل النموذجان على حوالي 50% فقط من الإجابات الصحيحة — وهو مستوى أقرب إلى التخمين العشوائي منه إلى الإجابات الدقيقة.
لماذا فشل أقوى نموذجين في العالم في هذه المهمة بالتحديد؟ الإجابة بسيطة ومفاجئة: لأن الإجابات الصحيحة لم تكن موجودة في البيانات العامة للتدريب مطلقًا.