უკან დაბრუნება
ახალი კვლევა: AI-ის ვებ-კონტენტს სიტყვებით კი არა, სტრუქტურით ამოიცნობენ
SiTech AI Team2 წთ. საკითხავი

ახალი კვლევა: AI-ის ვებ-კონტენტს სიტყვებით კი არა, სტრუქტურით ამოიცნობენ

arXiv-ზე გამოქვეყნებული კვლევა აჩვენებს, რომ AI-ის მიერ დაწერილი კომერციული ბლოგები სიტყვების ნაცვლად სტრუქტურული ნიშნებითაც ამოიცნობა: 187 სტრუქტურული ნიშნის მქონე მოდელი 98.0 macro-F1-ს აღწევს და ტექსტის გადაწერის შემდეგაც უცვლელი რჩება.

ახალი ნაშრომი arXiv-ზე ამოწმებს, შეიძლება თუ არა AI-ის მიერ დაწერილი კომერციული ვებ-კონტენტის ამოცნობა სიტყვების ნაცვლად სტრუქტურით. Sitefire-ის მკვლევრის, ჯოხენ მადლერის ნაშრომი „SlopShape“ იტყობინება, რომ 214 ნიშნისგან შემდგარი ინსტრუმენტი, რომელთაგან 187 სტრუქტურულია, AI-ის კორპორაციულ ბლოგებს ადამიანის ტექსტისგან 98.0 macro-F1-ით არჩევს.

რა შეისწავლეს

კვლევა კომერციულ კონტენტზე გადააქვს StoryScope — ნაშრომი, რომელმაც AI-ის მხატვრულ ტექსტში სტრუქტურული ნიშნები აღმოაჩინა. კორპუსი 268 კომპანიის დომენიდან 2,250 ადამიანურ ბლოგ-პოსტს (ChatGPT-მდე, 2008–2022 წლებში გადაღებული Wayback-ის ასლები) 11,250 AI „სარკეს“ უპირისპირებს: იგივე ბრიფის მიხედვით ხუთი წამყვანი მოდელი წერს — GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 და Kimi K2.5.

თითოეული პოსტი 11 განზომილების კომერციული სქემით შეფასდა: მიზანი, სტრუქტურა, მტკიცებულებები, ტონი, ფორმატი. ინსტრუმენტს LLM-ი იყენებს; ადამიანური ანოტაციის სესიამ ანოტატორებს შორის 0.928, ადამიანსა და მოდელს შორის კი 0.946 თანხვედრა აჩვენა.

კვლევის მეთოდოლოგიის სქემა

სტრუქტურა სტილს სჯობს და გადაწერას უძლებს

მხოლოდ სტრუქტურულმა ნიშნებმა ტრენინგში არ ნანახ კომპანიებზე 98.0 macro-F1 მისცა, სტილის ნიშნებმა კი მხოლოდ 88.1. სიტყვების დონეზე მომუშავე დეტექტორები რედაქტირებულ AI-ტექსტზე უნაკლო იყო, თუმცა გადაწერის შემდეგ ეს უპირატესობა ქრება: როცა სატესტო ნაკრების ყველა AI-პოსტი მისივე მოდელმა გადაწერა, სტრუქტურულმა მოდელმა მაინც 98.1 დაიმსახურა და პოსტების 79.3 პროცენტი ექვსი წყაროდან სწორს მიაკუთვნა — შემთხვევითობის 16.7 პროცენტის ფონზე.

ტოპ-20 სტრუქტურული ნიშანი

მოწესრიგებული პოსტი, რომელიც თავად აცხადებს თავს

სიგნალის უმეტეს ნაწილს ათი ნიშანი ატარებს: შედეგს სათაურშივე გვპირდებიან, თეზისი და აგებულება პირველ განყოფილებამდე ცხადდება, ტონი განმარტებით-რედაქციულია, დასკვნა კი თეზისს იმეორებს. ადამიანური პოსტები საპირისპიროსკენ იხრება — გამოცხადებული თანმიმდევრობის, რისკის ესკალაციისა და თეზისის გამეორების გარეშე; მხოლოდ ამ ათ ნიშანზე აწყობილი კლასიფიკატორი მაინც 93.5 macro-F1-ს აღწევს.

ადამიანური პოსტები სტრუქტურულ სივრცეში უფრო იშვიათ არეალებს იკავებს: იშვიათობის საშუალო პერცენტილი 0.838-ია, AI-პოსტებში კი 0.435; ყველაზე იშვიათ ერთ პროცენტში 149 პოსტი ადამიანურია, მხოლოდ 4 კი — AI-ის.

ღია გამოქვეყნება და შეზღუდვები

პაიპლაინი, ინსტრუმენტი, პრომპტები და კოდი GitHub-ზეა. ნაშრომი შეზღუდვებსაც ასახელებს: კორპუსი პროგრამულ და ამერიკულ კომპანიებზეა გადახრილი, AI-სარკეები ნაკლები კონტექსტის ბრიფებით დაიწერა, გადაწერის ტესტი კი მოდელების თვითგადაწერას მოიცავს და არა კომერციულ „humanizer“ ხელსაწყოებს. ავტორი აცხადებს, რომ კომერციულ GEO პროდუქტს, Sitefire-ს ხელმძღვანელობს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.