Ինչու GPT-ն և Claude-ն ձախողվեցին Bridgewater-ի ֆինանսական թեստերում — ճիշտ պատասխանները երբեք հանրային չեն եղել
Bridgewater Associates-ը և Thinking Machines Lab-ն ապացուցեցին, որ GPT-ն և Claude-ն ֆինանսական փաստաթղթերի վերլուծության մեջ ունեն ~50% ճշգրտություն — քանի որ ճիշտ պատասխանները երբեք չեն եղել նրանց հանրային ուսուցման տվյալներում:
💰 GPT-ի և Claude-ի ձախողած թեստը — 50% ճշգրտություն ֆինանսական փաստաթղթերում
Այսօրվա մրցակցային AI աշխարհում ամեն օր լսում ենք, թե ինչպես են խոշոր լեզվական մոդելները (LLMs) լուծում բարդ խնդիրներ՝ ծրագրավորումից և մաթեմատիկայից մինչև իրավունք: Բայց երբ GPT-4.1-ը և Claude-ը բախվեցին Bridgewater Associates-ի սեփական ֆինանսական տվյալների բազաներին, արդյունքը ցնցող էր: Երկու մոդելներն էլ ստացան միայն 50% ճիշտ պատասխաններ՝ մի մակարդակ, որն ավելի մոտ է պատահական գուշակությանը, քան ճշգրիտ վերլուծությանը:
Ինչո՞ւ աշխարհի երկու ամենահզոր մոդելները ձախողվեցին այս կոնկրետ առաջադրանքում: Պատասխանը պարզ է և զարմանալի. որովհետև ճիշտ պատասխանները երբեք չեն հայտնվել հանրային ուսուցման տվյալներում: