
Privatemode перетворив GLM-5.3-Flash на модель рішень на кшталт Jev
Німецький провайдер конфіденційних обчислень показав, що звичайна LLM може ухвалювати типізовані рішення з імовірністю для кожного варіанта за один прямий прохід, не поступаючись Jev у точності на 29 наборах даних.
Privatemode AI показала, як із готової мовної моделі зробити модель ухвалення рішень. У блозі, опублікованому 24 вересня, німецький провайдер конфіденційних обчислень повідомив, що GLM-5.3-Flash повертає типізовані рішення з імовірністю для кожного варіанта за один прямий прохід і без донавчання.
Моделі, створені саме для цього завдання, зокрема Jev від TypeSafe та Laya від Convai, повертають обраний варіант разом зі значенням упевненості для кожного. Метод Privatemode дає готовій LLM таку саму поведінку.
Як працює метод
Мовна модель ніколи не пише текст напряму: на кожному кроці вона видає розподіл імовірностей за всім своїм словником. Саме це й використовує підхід. Стан, питання та пронумеровані варіанти потрапляють у промпт у форматі JSON, а промпт уже завершується префіксом choice_index:, тож наступний токен моделі має бути номером варіанта. Бібліотека не читає цей токен: вона зчитує ймовірності, які модель призначила всім номерам варіантів у цій позиції, і нормалізує їх між варіантами.
Реалізація запускає GLM-5.3-Flash на vLLM і використовує /chat/completions з параметрами continue_final_message та add_generation_prompt: false. allowed_token_ids у vLLM звужує словник до номерів варіантів, а logprob_token_ids повертає логарифмічні ймовірності саме запитаних токенів.
Точність на рівні Jev
Автори перевірили три системи на 29 публічних розмічених наборах даних із 2-151 варіантами, від маршрутизації запитів до сканованих документів, англійською й німецькою. На 28 текстових наборах GLM-5.3-Flash і Jev ідуть нарівні: кожен точніший на 10 наборах, ще вісім різняться менш ніж на один відсотковий пункт, а медіанний розрив 0,7 пункту на користь Jev статистично незначущий (p = 0,64). Laya, модель на 421 мільйон параметрів, запущена локально, відстає від обох на 13-15 пунктів.
Швидкість, ціна та зображення
Час відповіді залежить від географії: при вимірюванні по одному запиту Privatemode відповідав за 180 мс із Німеччини проти 264 мс у Jev, а зі США порядок змінюється: 164 мс у Jev проти 299 мс у Privatemode. За ціною дешевший Jev: мільйон рішень коштує близько 62 євро з GLM-5.3-Flash і близько 16 євро з Jev. Jev додає приблизно 270 токенів на запитання плюс 10 на варіант, а промпт GLM-5.3-Flash близько 55 плюс 20.
Оскільки GLM-5.3-Flash працює із зображеннями, питання може містити картинки; Jev і Laya працюють лише з текстом. На RVL-CDIP, наборі з 1 600 сканованих ділових документів у 16 класах, модель досягає 70,2% точності, а зображення додає близько 1 350 вхідних токенів. Автори також наводять обмеження: режим із міркуванням точніший, але коштує близько 350 євро за мільйон рішень.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.