Վերադառնալ
SiTech Team⏱️ 5 წთ. საკითხავი

AI տեքստի դետեկտորները դժվարանում են, երբ լեզվական մոդելները ընդօրինակում են հեղինակի ոճը — հետազոտություն

AI տեքստի դետեկտորները դժվարանում են, երբ լեզվական մոդելները ընդօրինակում են հեղինակի ոճը — հետազոտություն

Epoch AI-ի հետազոտությունը ցույց է տվել, որ Pangram, GPTZero և Originality.ai 13% դեպքերում չեն հայտնաբերում AI-գեներացված տեքստը, եթե այն ընդօրինակում է հեղինակի ոճը — գիտական տեքստերում այդ ցուցանիշը հասնում է 24-29%-ի:

Epoch AI-ի հիմնարար հետազոտությունը. ինչպես են փորձարկել դետեկտորները

Epoch AI-ի հետազոտական խումբը իրականացրել է երեք հայտնի AI տեքստի դետեկտորների լայնածավալ գնահատում՝ Pangram (տարբերակ 3.3.2), GPTZero (մոդել 2026-05-11-base) և Originality.ai (Turbo 3.0.2): Նպատակն էր պարզել, թե որքանով են արդյունավետ այս գործիքները, երբ արհեստական բանականությունը դիտավորյալ ընդօրինակում է կոնկրետ հեղինակի գրելու ոճը:

Հետազոտողները ստեղծել են 495 մարդու կողմից գրված տեքստերի կորպուս 99 հեղինակներից, որը հավասարապես բաշխված էր երեք կատեգորիաներում՝ բլոգինգ, գեղարվեստական գրականություն և գիտական գրություն: Բոլոր տեքստերը գրվել էին ChatGPT-ի թողարկումից առաջ (2022 թվականի նոյեմբեր), ինչը գործնականում բացառում է լեզվական մոդելներով աղտոտման ռիսկը:

Փորձարկման կառուցվածքը երկաստիճան էր: Առաջին փուլում ստուգվեց, թե որքան լավ են դետեկտորները հայտնաբերում սովորական AI-գեներացված տեքստը՝ առանց ոճի ընդօրինակման: Երկրորդ փուլում երեք առաջատար AI մոդելներ՝ Claude Opus 4.8, GPT-5.5 և Gemini 3.1 Pro, ստացան հեղինակի հինգ իրական տեքստ և պետք է ստեղծեին նոր տեքստ նույն ոճով:

📖 Աղբյուր

Գրեթե կատարյալ արդյունքներ պարզ AI տեքստի վրա

Երբ դետեկտորներին տրամադրվեց սովորական AI-գեներացված տեքստ (առանց ոճի ընդօրինակման), երեքն էլ ցույց տվեցին գրեթե անթերի արդյունք: Կեղծ-բացասական ցուցանիշը կազմում էր առավելագույնը 0,7% — այսինքն՝ դետեկտորները գրեթե բոլոր AI տեքստերը ճիշտ էին ճանաչում:

Մարդու կողմից գրված տեքստերը նույնպես հիմնականում ճիշտ դասակարգվեցին: Pangram-ը և GPTZero-ն չառաջացրին ոչ մի կեղծ ահազանգ — նրանք ճիշտ ճանաչեցին բոլոր մարդու տեքստերը որպես մարդու կողմից գրված: Սա նշանակում է, որ եթե ուսուցիչը կամ հրատարակիչը օգտագործում է այս գործիքները, նրանք գրեթե երբեք չեն մեղադրի անմեղ հեղինակին AI-ի օգտագործման մեջ:

Այնուամենայնիվ, Originality.ai-ն ցույց տվեց մտահոգիչ արդյունք. այն 495 մարդու տեքստերից 19-ը սխալմամբ համարեց AI-գեներացված, ինչը կազմում է 3,8% կեղծ-դրական ցուցանիշ: Սա նշանակում է, որ մոտավորապես յուրաքանչյուր 26 մարդու գրած տեքստից մեկը կարող է սխալմամբ համարվել AI-ի կողմից գրված:

📖 Աղբյուր

Ոճի ընդօրինակումը կտրուկ նվազեցնում է դետեկտորների արդյունավետությունը

Պատկերը կտրուկ փոխվում է, երբ AI մոդելները ստանում են հեղինակի տեքստերի նմուշներ և խնդրում ընդօրինակել նրանց ոճը: Epoch AI-ի տվյալներով, 297 այսպես գեներացված տեքստերից միջինը 38 մնացին չնկատված — սա 13% կեղծ-բացասական ցուցանիշ է:

Դետեկտորների միջև տարբերությունները, այնուամենայնիվ, նկատելի էին: Pangram-ը չհայտնաբերեց ոճի ընդօրինակմամբ ստեղծված տեքստերի 10%-ը, GPTZero-ն՝ 11%-ը, իսկ Originality.ai-ն՝ 18%-ը: Սա նշանակում է, որ Originality.ai-ն գրեթե յուրաքանչյուր հինգերորդ AI տեքստը չի նկատում, եթե այն ընդօրինակում է հեղինակի ոճը:

Հետաքրքիր է, որ գեղարվեստական գրականության կատեգորիայում արդյունքները համեմատաբար լավ էին — կեղծ-բացասական ցուցանիշը կազմում էր ընդամենը 1-5%: Սակայն հենց գեղարվեստական գրականությունն է այն կատեգորիան, որտեղ ոճի նույնականացումն ամենահեշտն է:

📖 Աղբյուր

Ակադեմիական տեքստեր — ամենաթույլ կետը

Գիտական գրությունն այն կատեգորիան էր, որտեղ բոլոր դետեկտորները ցույց տվեցին ամենավատ արդյունքները: Pangram-ը չհայտնաբերեց ոճի ընդօրինակմամբ ստեղծված ակադեմիական AI տեքստերի 25%-ը, GPTZero-ն՝ 24%-ը, իսկ Originality.ai-ն՝ 29%-ը: Սա վկայում է, որ հենց այն ոլորտում, որտեղ AI դետեկտորներն ամենաշատն են օգտագործվում — կրթության և ակադեմիական շրջանակներում — դրանք ամենաքիչ հուսալի են:

Ամենադրամատիկ արդյունքները հայտնաբերվեցին կոնկրետ մոդելի և ժանրի համակցություններում: Pangram-ը չհայտնաբերեց Gemini-ի կողմից գեներացված ակադեմիական տեքստերի 48%-ը — գրեթե յուրաքանչյուր երկրորդ տեքստը: Originality.ai-ն չհայտնաբերեց GPT-5.5-ի ակադեմիական տեքստերի 39%-ը: Այս տվյալները հատկապես մտահոգիչ են այն ֆոնին, որ ուսանողներն ու հետազոտողները գնալով ավելի հաճախ են դիմում AI-ին գիտական տեքստեր գրելու համար:

Խնդիրն այն է, որ գիտական գրությունը ոճական առումով ավելի միատարր է — այն օգտագործում է պաշտոնական լեզու, ստանդարտ կառուցվածք և որոշակի տերմինաբանություն: Ուստի AI-ի համար ավելի հեշտ է ընդօրինակել գիտական ոճը:

📖 Աղբյուր

Տարբեր մոտեցումներ, նույն կույր կետերը

Փորձարկված երեք դետեկտորներից յուրաքանչյուրն օգտագործում է տարբեր մեթոդաբանություն, սակայն բոլորն էլ ցույց են տալիս նույն խոցելիությունը ոճի ընդօրինակման նկատմամբ: Pangram-ը հիմնվում է նեյրոնային ցանցի վրա, որը վերապատրաստված է մարդկային և մեքենայական տեքստերի վրա — սակայն նրա հիմնադիրն ինքն է համակարգը անվանել "սև արկղ", քանի որ նրա որոշումները հնարավոր չէ հետևել:

GPTZero-ն չափում է, թե որքան կանխատեսելի է բառերի ընտրությունը տեքստում և որքան է փոխվում այդ ցուցանիշը տեքստի ընթացքում: Նրա տրամաբանությունը պարզ է. լեզվական մոդելներն ավելի միատարր են գրում, քան մարդիկ: Originality.ai-ն փնտրում է վիճակագրական օրինաչափություններ, որոնք սովորել է մարդկային և AI տեքստերի ուսուցողական տվյալներից:

Չնայած տարբեր մոտեցումներին, երեք դետեկտորներն էլ ցույց են տալիս նույն խոցելիությունը: Նրանք գրեթե միշտ հայտնաբերում են պարզ հարցումով ստեղծված տեքստը, բայց հաճախ չեն նկատում ոճի ընդօրինակմամբ ստեղծված տեքստերը: Եվ հենց այն ժանրը, որտեղ AI հայտնաբերումն ամենաշատ գործնական կիրառությունն ունի — գիտական գրությունը — մնում է ամենադժվար մարտահրավերը:

📖 Աղբյուր

Նախորդ հետազոտությունները և ինչու է Epoch AI-ի աշխատանքը կարևոր

Authors Guild-ի նախորդ թեստը ցույց տվեց, որ Pangram-ը և Originality.ai-ն հուսալիորեն ճանաչում են մարդկային տեքստերը որպես մարդու կողմից գրված: Epoch AI-ի հետազոտությունը լրացնում է պատկերի երկրորդ կեսը. ցածր կեղծ-դրական ցուցանիշը մարդկային տեքստերի վրա քիչ բան է ասում այն մասին, թե քանի AI-գեներացված տեքստ է իրականում մնում չնկատված:

Սա հատկապես կարևոր է այն ոլորտների համար, որտեղ AI դետեկտորներն առավել ինտենսիվ են օգտագործվում — համալսարաններում, հրատարակչություններում, լրագրության մեջ: Եթե դետեկտորը հայտնում է, որ տեքստը "գրված է մարդու կողմից", դա չի նշանակում, որ այն իրոք մարդու աշխատանք է — հնարավոր է, AI-ն պարզապես լավ է ընդօրինակել ոճը:

Հետազոտությունը բարձրացնում է խոր էթիկական և գործնական հարցեր AI-ի օգտագործման կարգավորման վերաբերյալ ակադեմիական և մասնագիտական գրության մեջ: 13% միջին ցուցանիշը նշանակում է, որ յուրաքանչյուր 7-8 AI տեքստից մեկը մնում է չնկատված: Իսկ գիտական տեքստերում՝ յուրաքանչյուր չորրորդը:

📖 Աղբյուր

Ինչ է սա նշանակում ապագայի համար

Epoch AI-ի հետազոտությունը կարևոր նախազգուշացում է. AI տեքստի դետեկտորներն այնքան հուսալի չեն, որքան նախկինում ենք կարծում: Նրանց արդյունավետությունը կտրուկ նվազում է, երբ AI մոդելները դիտավորյալ փորձում են ընդօրինակել ոճը: Սա հատկապես խնդրահարույց է կրթության համակարգում, որտեղ այս գործիքները լայնորեն օգտագործվում են ուսանողական աշխատանքները ստուգելու համար:

Ոճի ընդօրինակումը մատչելի տեխնիկա է, որը չի պահանջում առանձնահատուկ բարդություն. բավական է մոդելին տրամադրել հեղինակի մի քանի տեքստ, և այն արդեն կկարողանա ընդօրինակել նրա գրելու ոճը: Սա նշանակում է, որ ապագայում AI-ի օգտագործման հայտնաբերումն էլ ավելի կբարդանա:

Անհրաժեշտ են նոր մոտեցումներ AI տեքստի հայտնաբերման մեջ — հնարավոր է, միայն վիճակագրական վերլուծությունն այլևս բավարար չէ: Ապագան հնարավոր է պատկանի հիբրիդային մեթոդներին, որոնք միավորում են տեքստի վերլուծությունը, մետատվյալների ստուգումը և գրելու պատմության հետազոտությունը: Մինչ այդ, AI տեքստի դետեկտորների արդյունքները պետք է ընդունել զգուշությամբ:

📖 Աղբյուր