חזרה
מחקר חדש: תוכן AI ברשת מזוהה לפי מבנה, לא לפי מילים
SiTech AI Team2 წთ. საკითხავი

מחקר חדש: תוכן AI ברשת מזוהה לפי מבנה, לא לפי מילים

מאמר ב-ArXiv מראה שאפשר להבדיל בין פוסטים מסחריים שנכתבו בידי AI לבין כתיבה אנושית לפי המבנה בלבד: 187 מאפיינים מבניים מגיעים ל-macro-F1 של 98.0, והתוצאה כמעט לא משתנה כשמנסחים מחדש כל פוסט של AI.

מאמר חדש ב-ArXiv בוחן אם אפשר לזהות תוכן מסחרי שנכתב בידי AI לפי המבנה שלו ולא לפי המילים. המאמר „SlopShape“ מאת יוכן מדלר מ-Sitefire מדווח כי מכשיר של 214 מאפיינים, 187 מהם מבניים, מבדיל בין פוסטים בבלוגים של חברות שנכתבו בידי AI לבין כתיבה אנושית ב-macro-F1 של 98.0.

מה נמדד

המחקר מעביר לזירה המסחרית את StoryScope, עבודה קודמת שמצאה חתימות מבניות בפרוזה בדיונית של AI. הקורפוס מצמיד 2,250 פוסטים אנושיים מ-268 דומייני חברות (צילומי Wayback מלפני ChatGPT, 2008–2022) ל-11,250 „מראות“ של AI: אותן תקצירים הועברו לחמישה מודלים מובילים — GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 ו-Kimi K2.5.

כל פוסט נמדד מול סכימה מסחרית בת 11 ממדים: מטרה, מבנה, ראיות, קול ופורמט עמוד. את המכשיר הפעיל מודל שפה, וסשן תיוג אנושי הגיע להסכמה של 0.928 בין מתייגים ו-0.946 בין אדם למודל.

מבנה המחקר: צינור המדידה

מבנה מנצח סגנון ושורד ניסוח מחדש

מאפיינים מבניים בלבד הגיעו ל-macro-F1 של 98.0 בחברות שלא נראו באימון, בעוד מאפייני סגנון בלבד הגיעו ל-88.1. גלאים ברמת המילה היו מושלמים על טקסט AI שלא נערך, אך היתרון הזה אינו שורד שכתוב: כשכל פוסט AI בקבוצת המבחן נוסח מחדש בידי המודל שיצר אותו, המודל המבני עדיין קיבל 98.1 ושייך 79.3 אחוזים מהפוסטים למקור הנכון מבין שישה — לעומת 16.7 אחוזים במקריות.

20 המאפיינים המבניים החשובים

הפוסט המסודר שמכריז על עצמו

עשרה מאפיינים נושאים את רוב האות: התשואה מובטחת כבר בכותרת, התזה והמבנה מוכרזים לפני הפרק הראשון, הקול הוא של מסביר מערכתי, והסיום מחזיר על התזה. פוסטים אנושיים נוטים לכיוון ההפוך — בלי מהלך מוכרז, בלי הסלמת סיכונים ובלי סיום שמחזיר על התזה; מסווג שמוגבל לעשרת המאפיינים האלה עדיין מגיע ל-macro-F1 של 93.5.

פוסטים אנושיים גם תופסים אזורים נדירים יותר במרחב המבני: אחוזון הנדירות הממוצע שלהם 0.838 לעומת 0.435 בפוסטים של AI, ומבין האחוז הנדיר ביותר, 149 אנושיים ורק 4 של AI.

פרסום פתוח ומגבלות

הצינור, המכשיר, הפרומפטים, הקוד והארטיפקטים המצטברים פורסמו ב-GitHub. המאמר מציין גם את מגבלותיו: קורפוס מוטה לתוכנה ולחברות אמריקאיות, מראות שנכתבו מתקצירים דלים יותר בהקשר, ומבחן ניסוח מחדש שמכסה שכתוב עצמי ולא כלי „humanizer“ מסחריים. המחבר גם מגלה שהוא מפעיל את Sitefire, מוצר GEO מסחרי.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.