Վերադառնալ
Aleph Alpha-ի բենչմարկը. չինական AI մոդելները հատուկ գիծ են հետևում զգայուն թեմաներին
SiTech AI Team2 րոպե ընթերցում

Aleph Alpha-ի բենչմարկը. չինական AI մոդելները հատուկ գիծ են հետևում զգայուն թեմաներին

Aleph Alpha-ի թեստում չինական AI մոդելները հաճախ կրկնում էին պետական դոկտրինան, խուսափում կամ չէին պատասխանում 967 զգայուն թեմայներին, իսկ որոշ արևմտյան մոդելներ ավելի հավասարակշռված էին.

Բենչմարկը ստուգում է քաղաքականորեն զգայուն հարցերը

Aleph Alpha-ի հետազոտությունը ստուգեց Alibaba-ի Qwen-ը, DeepSeek-ը և Moonshot AI-ի Kimi-ի մոդելները 967 ձեռքով ընտրված արգելված թեմաների դեմ, այդ թվում՝ Թիանանմենը, Թայվանը և Սինցզյանը: Ընկերության սեփական AI գնահատման համակարգը մոդելների պատասխանների միայն 17%-ից 41%-ը գնահատեց որպես հավասարակշռված: Ըստ բենչմարկի, մնացած պատասխանները կրկնում էին պետական դոկտրինան, խուսափում կամ մերժում էին պատասխանելուց:

Aleph Alpha-ը, Cohere-ի հետ միասին, ներկայացնում է ինքը որպես «գերության AI» մատակարար կառավարությունների համար: Հաշվետվության տվյալներով, սա ընկերությանը տալիս է մեկնաբանություն սեփական մոդելները չինական մրցակիցներից տարբերելու համար:

Արդյունքները տարբերվում են ըստ մոդելների

Քաղաքականորեն զգայուն հարցերին DeepSeek V4 Pro-ը մերժեց երկու երրորդը: Համեմատության համար, Claude Sonnet 5-ը և Mistral Small-ը հավասարակշռված պատասխաններ տվեցին համապատասխանաբար 70%-ի և 92%-ի դեպքերում:

Արդյունքները համապատասխանում են չինական կանոնակարգերին, որոնք պահանջում են «սոցիալիստական միության արժեքների» պաշտպանությունը հանրային մոդելներում: Հաշվետվությունը նաև վերաբերում է նախնական աուդիտներին և կրկնվող անեկդոտային տեղեկություններին, թե չինական մոդելները հետևում են հատուկ գիծը Թիանանմենի, Թայվանի և Սինցզյանի թեմաների վերաբերյալ:

Հակասությունը կարող է տարածվել նաև չկապված հարցերի վրա

Երբ Qwen 3.6-ին հարցրին Միացյալ Նահանգներում սենզորի մասին, այն սկզբում տվեց համեմատաբար հավասարակշռված պատասխան, բայց վերջում պաշտպանեց Չինաստանի դիրքը ցանցային կառավարման վերաբերյալ: Այն ասաց. «Շատ երկիր, այդ թվում Չինաստանը, նախանձում է ինֆորմացիայի վերահսկումը սոցիալական կայունության և ազգային անվտանգության ապահովման նպատակով»:

Հանգիստ հարցերի համար, որոնք քաղաքականորեն դրսեցված չէին, ստուգված չինական մոդելները հիմնականում տվեցին հավասարակշռված պատասխաններ: Հաշվետվության տվյալներով, այս հարցերի համար Չինաստանին աջակցող հակասությունը նվազում էր, բայց դեռ առկա էր Qwen 3.6-ի և DeepSeek V4 Pro-ի մոդելներում:

Կենտրոնական Եվրոպայի Ազիայի հետազոտության ինստիտուտի նախնական հետազոտությունը հայտնաբերեց միևնուն տարածման ազդեցությունը: Մարդկային իրավունքների, դիմադրության կամ ուսումնասիրության վերաբերյալ հարցերը հաճախ առաջացնում էին Պեկինի ստանդարտ արտահայտությունները, այդ թվում՝ «ներքին գործերին միջմտելու սկզբունքը» և «մարդկության ընդհանուր ապագայի թեման»:

Ուսուցողական տվյալները կարող են փոխանցել քաղաքական արժեքներ

Aleph Alpha-ը նաև ստուգեց Nvidia-ի Nemotron Cascade 2-ը, որը ցուցադրեց հակասության գիծը պատասխանների 17%-ում: Ընկերությունը այս արդյունքը վերագրեց մոդելի 9,3 միլիոն ուսուցողական օրինակներից մոտ 3 500-ին, որոնք գեներացվել էին DeepSeek-ի և Qwen-ի օգտագործմամբ:

Երբ Nemotron Cascade 2-ին խնդրեցին կազմել Թայվանի ճանաչման կողմնորոշումների նախագիծը, այն մերժեց և տվեց Պեկինի «մեկ Չինաստան» սկզբունքի պաշտպանությունը պատրիոտական պատասխանով:

Հետազոտները հավակնում են, որ լեզվի մոդելները կարող են ընդունել մշակութային և քաղաքական արժեքներ, երբ ուսուցողական տվյալներում որոշ դիտակետներ գերակշռում են կամ երբ տվյալները նախապես ընտրվում են: Նրանք նախազգուշացնում են, որ միագույն AI գեներացիայի կրկնվող եփումը կարող է ազդել նրանց մտածելու և ինքնատեսակի վերաբերյալ կախվածության վրա միլիարդավոր օգտատերերի համար:

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։