
Jev корисний без навчальних даних, але його ймовірності не відкалібровані для вас
Jev від TypeSafe повертає типізовані рішення замість тексту, кожне з прикріпленою ймовірністю. Новий аналіз твердить, що заява про калібрування загалом не виконується: модель, відкалібрована на одному розподілі, може бути погано відкалібрована на вашому.
Jev — це перша "System One Model" від TypeSafe. Замість генерації тексту вона приймає неструктуровані дані й повертає типізовані рішення з наперед заданого набору, кожне з прикріпленою ймовірністю. За словами компанії, відповіді супроводжуються відкаліброваними ймовірностями. У публікації від 23 вересня 2026 року Alex Molas доводить, що Jev корисний, але заява про калібрування не виконується загалом: результати варто сприймати як оцінки, а не як імовірності.
Корисний без навчальних даних
Jev можна застосувати до будь-якої задачі класифікації без збору навчальних даних і отримати прийнятні результати. Багато хто в Twitter казав, що це "просто донавчений BERT", але донавчання BERT потребує даних, тож коли даних немає, Jev — хороша альтернатива. До того ж Jev — універсальний класифікатор, тоді як донавчений BERT працює лише зі своїм завданням. І саме тому його ймовірності не можуть бути відкалібровані для вас.
Калібрування залежить від ваших даних
TypeSafe каже, що Jev навчали за допомогою RLCD, reinforcement learning для каліброваних рішень, і що його ймовірності відкалібровані. Molas не погоджується: модель може бути відкалібрована на даних TypeSafe і залишатися погано відкаліброваною на ваших. Калібрування означає: для будь-якої передбаченої ймовірності p справжня ймовірність позитивного класу за такого прогнозу дорівнює p. Якщо Jev оцінює лист на 0,7 за ймовірністю спаму, близько 70% таких листів справді мають бути спамом.
Калібрування — властивість не лише моделі, а й розподілу ваших даних. Одна модель може бути відкалібрована на одному наборі й не бути на іншому. Дві компанії можуть визначати спам однаково, але мати різні дані; на той самий запит і промпт Jev поверне обом ту саму ймовірність. Навіть якщо RLCD справді навчив Jev калібрування на його розподілі, на вашому продакшн-трафіку ймовірності можуть залишитися невідкаліброваними.
Проблема глибша за зсув розподілу
Автор також знайшов приклади, де Jev каже, що чесна монета випаде орлом з імовірністю 0,92. Справжня ймовірність є прямо в промпті, і модель її все одно не називає, що гірше за звичайний зсув розподілу. Якщо значення ймовірностей залежить від того, який примітив ви використовуєте, що взагалі означає "відкалібровані ймовірності"?
Перекалібруйте або ставтеся до виходу як до оцінки
Якщо вам потрібні відкалібровані ймовірності, числа Jev доведеться перекалібрувати на власних даних. Добра новина: це дешево. Кількох сотень розмічених прикладів із вашого реального трафіку може бути достатньо, щоб накласти Platt scaling на оцінки Jev.
Ставтеся до виходів Jev як до добрих оцінок, які добре впорядковують приклади, а не як до добрих ймовірностей. Якщо система залежить від конкретного числа, порогів, очікуваних витрат чи поєднання моделей, виміряйте калібрування на своїх даних.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.