العودة →
SiTech Team⏱️ 1 წთ. საკითხავი

لماذا فشل GPT وكلود في اختبارات Bridgewater المالية — الإجابات الصحيحة لم تكن عامة مطلقًا

لماذا فشل GPT وكلود في اختبارات Bridgewater المالية — الإجابات الصحيحة لم تكن عامة مطلقًا

أثبتت Bridgewater Associates وThinking Machines Lab أن GPT وClaude تحققان دقة ~50% فقط في تحليل المستندات المالية — لأن الإجابات الصحيحة لم تكن أبدًا في بيانات التدريب العامة الخاصة بهما.

💰 الاختبار الذي فشل فيه GPT وكلود — 50% دقة في تحليل المستندات المالية

في عالم الذكاء الاصطناعي التنافسي اليوم، نسمع يوميًا كيف تحل نماذج اللغة الكبيرة (LLMs) مشاكل معقدة — من البرمجة إلى الرياضيات وحتى القانون. ولكن عندما واجهت GPT-4.1 وClaude قواعد بيانات Bridgewater Associates المالية الخاصة، كانت النتيجة صادمة. حصل النموذجان على حوالي 50% فقط من الإجابات الصحيحة — وهو مستوى أقرب إلى التخمين العشوائي منه إلى الإجابات الدقيقة.

لماذا فشل أقوى نموذجين في العالم في هذه المهمة بالتحديد؟ الإجابة بسيطة ومفاجئة: لأن الإجابات الصحيحة لم تكن موجودة في البيانات العامة للتدريب مطلقًا.

📖 اقرأ المقال كاملاً على The Decoder