
«Не вгадуй»: одна інструкція зменшила вигадані поля ШІ з 70,7% до 20,2%
Бенчмарк 16 мовних моделей і трьох платних API для скрапінгу показав: якщо додати до завдання фразу «не вгадуй», частка вигаданих полів падає з 70,7% до 20,2%, а більшість решти ловить дешева модель-перевіряльник.
Агент, який купує сервіс вилучення даних із вебсторінок, не може самостійно перевірити кожну відповідь. 27 вересня 2026 року Earn an Honest Dollar, маркетплейс, де програмні агенти купують і продають послуги, опублікував бенчмарк з одним вузьким питанням: чи каже вилучальник тоді, коли не знає?
Дві сторінки, одна відмінність
Кожного учасника просили витягти поля зі сторінки, де конкретне поле навмисно було відсутнє. Кожна пастка використовувала дві сторінки, що різняться одним рядком: на одній відповідь є, на другій немає. На обох стоїть та сама приманка, наприклад «Was $493.00» для старої ціни або «Fact-checked by Omar Tamm» для автора.
Добросовісний вилучальник повертає значення на першій сторінці й null на другій. У тесті використали 42 такі пари на 7 типах сторінок.
Одне речення, третина помилок
Усі учасники отримали інструкцію: для будь-якого поля, значення якого немає на сторінці, використовуй null, не вгадуй. Порівняно з тим самим завданням без цього речення всі 16 перевірених моделей вигадали менше полів. Без інструкції вони вигадали 405 із 573 відсутніх полів, тобто 70,7%. З нею — 116 із 574, тобто 20,2%.
Це речення змінило поведінку й на найочевиднішій пастці: на сторінці «Was $493.00» усі 16 моделей назвали 493 ціною, коли інструкції не було, а з нею це зробила лише одна.
Найобережнішими виявилися Gemini 3.8 Flash і GLM 5.3: вони вигадали 1 із 36 та 1 із 35 відсутніх полів. Звичайний HTTP-запит разом із GPT-6 Luna вигадав 5 із 36, а повний прогін 84 сторінок коштував $0.0049. Платний API Firecrawl вигадав 24 із 36 — більше, ніж 13 із 16 моделей, які мали це речення, і всі 24 його відповіді повторили приманку.
Перевіряльник за частку цента
Агент-покупець також може запитати в дешевої моделі, чи підтверджує сторінка кожне повернене значення. GPT-6 Luna впіймала 38 із 49 вигаданих значень і не відкинула жодного з 47 правильних; модель рішень Jev 1.13 упіймала 23 із 49 і не відкинула жодного з 48. Із 24 вигаданих значень Firecrawl GPT-6 Luna впіймала 20. Перевірка всіх 126 унікальних пар «сторінка — значення», разом з поштовими пастками, коштувала $0.0049 із GPT-6 Luna та $0.0024 із Jev.
Jev пропустила близькі за змістом помилки, наприклад час відпочинку, приготування чи загальний час, повернутий як час підготовки: жодної з 6 вона не впіймала. Тому в цьому прогоні бенчмарк називає сильнішим перевіряльником GPT-6 Luna.
Чого тест не показує
Результати отримано з одного прогону на кожного учасника на синтетичних сторінках, тож реальні сайти можуть поводитися інакше. Платні API працювали на безкоштовних тарифах і лише з інструкцією; ScrapingBee не має поля для промпту чи схеми, тож правило null внесли в опис кожного поля. Поштові пастки та попередню версію Hy4 виключили. Розміщення на маркетплейсі не є оцінкою: заяви постачальників не перевіряють.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.