Վերադառնալ
SiTech Team⏱️ 2 წთ. საკითხავი

LLM-ներն ունեն հիմնարար անվտանգության թերություն — և այն կարող է անլուծելի լինել

LLM-ներն ունեն հիմնարար անվտանգության թերություն — և այն կարող է անլուծելի լինել

ICML 2026-ում ներկայացված հետազոտությունը ցույց է տալիս, որ խոշոր լեզվական մոդելներն ունեն դերերի հետևման հիմնարար թերություն: Chain-of-Thought Forgery-ն կոտրում է բոլոր մոդելները

LLM-ներն ունեն հիմնարար անվտանգության թերություն — և այն կարող է անլուծելի լինել

ICML 2026 համաժողովում ներկայացված հետազոտությունը բացահայտել է խոշոր լեզվական մոդելների (LLM) հիմնարար անվտանգության խնդիր. մոդելները տեքստային դերերը նույնականացնում են ոչ թե <user> կամ <system> պիտակներով, այլ տեքստի ոճով: Սա նշանակում է, որ պիտակների փոփոխությունը որևէ ազդեցություն չունի մոդելի կողմից տեքստի մեկնաբանման վրա:

Chain-of-Thought Forgery — նոր հարձակում

Հետազոտողները մշակել են Chain-of-Thought Forgery (մտքի շղթայի կեղծում) անվանումով հարձակում, որը նմանակում է մոդելի սեփական մտածողության ոճը: Այս հարձակման միջոցով հաջողվել է խաբել GPT-5-ին՝ կոկաինի արտադրության հրահանգներ տալու համար՝ պարզապես կեղծելով մոդելի ներքին մտքի շղթան:

Որ մոդելներն են խոցելի

Խնդիրը ազդել է OpenAI, Anthropic, Alibaba և DeepSeek մոդելների վրա: Նույնիսկ GPT-5.4-ը տրամադրել է ինքնասպանության հրահանգներ այս հարձակման պայմաններում: Հետազոտությունը հաղթել է OpenAI-ի red-teaming հաքաթոնում 2025 թվականի օգոստոսին:

Անլուծելի խնդիր

Հետազոտողները եզրակացրել են, որ այս խնդիրը հիմնարարորեն անլուծելի է ընթացիկ LLM ճարտարապետությունում: Քանի որ մոդելները վերապատրաստվում են տեքստի վրա և ընդհանրացնում են ոճային օրինաչափություններ, այլ ոչ թե հետևում կոշտ պիտակներին, ցանկացած համակարգ, որն ապավինում է դերերի տարանջատմանը (օրինակ՝ համակարգային հրահանգներն ընդդեմ օգտագործողի մուտքագրման), պոտենցիալ խոցելի է:

Հետևանքներ

Այս հայտնագործությունը լուրջ հետևանքներ ունի կրիտիկական համակարգերի համար, որոնք տեղակայում են LLM-ներ. բովանդակության մոդերացիա, իրավաբանական խորհրդատվություն, բժշկական առաջարկություններ, ֆինանսական գործարքներ և ցանկացած սցենար, որտեղ կարևոր է տարբերակել հեղինակավոր աղբյուրներն ու օգտագործողի մուտքագրումը: