Назад
SiTech
Отже, хочете користуватися OpenRouter? Уроки 18 мільйонів повідомлень
SiTech AI Team3 წთ. საკითხავი

Отже, хочете користуватися OpenRouter? Уроки 18 мільйонів повідомлень

Автор асистента для iMessage пояснює, чому та сама відкрита модель поводиться по-різному в кожного постачальника: розриви в бенчмарках на 20 пунктів, «сліпі» зорові ендпоінти та порожні відповіді 200 OK.

Модель і постачальник — не одне й те саме

Мо Мустафа, автор Olly — ШІ-асистента, що живе в iMessage, — опублікував практичний путівник OpenRouter. Olly обробив понад 18 мільйонів повідомлень, приблизно третина з них — на відкритих моделях через цей сервіс; такий обсяг, за його словами, гарантує, що кожен крайовий випадок трапиться хоч раз. Термінологія автора пряма: модель — це ваги, а постачальник — це той, до кого OpenRouter вас спрямовує: він розміщує ваги на власних GPU, з власною точністю та власними парсерами, а отже, має власний список помилок. Запитуючи deepseek/deepseek-v4-flash, ви отримуєте одну з приблизно 20 компаній. «На папері це та сама модель, у реальності — геть різні».

Бенчмарки, зір і параметр effort

OpenRouter публікує бенчмарки для кожного постачальника на однакових вагах. У таблиці для DeepSeek V4 Flash 0731 від 7 вересня первинний DeepSeek має 90% на GPQA Diamond і 81% на TAU-Bench Airline (завдання з виклику інструментів), тоді як DigitalOcean — 75% і 58%. Більшість хостів відстають від первинного на 5–7 пунктів у виклику інструментів, а чотири провалюються в знаннях; у липні Fireworks мав 46% на TAU, тобто розрив у 30 пунктів. Зір не рівніший: під час тесту з трьома маленькими зображеннями Qwen-ендпоінт DeepInfra прочитав K як R, назвав червоне синім і описав слово «umbrella» як «funny», тоді як чотири інші хости з тими самими вагами розпізнали все правильно; Venice і Together взагалі не побачили зображення MiniMax, але все одно відповіли 200 OK. Параметр reasoning.effort приймається всюди, проте його дотримуються не всі: digitalocean, gmi-cloud, mancer і venice його фактично ігнорують.

Квантизація, парсинг і порожні відповіді

Фільтр за заявленою точністю якості не дає. Після місяця роботи з фільтром fp8 на DeepSeek хости fp4 опинилися в середині групи fp8, а три найгірші результати GPQA припали на один хост fp4, один fp8 і один, що не декларує нічого; на GLM найкращий результат узагалі не має декларації. Точність — поганий показник якості, а жорсткий фільтр ще й звужує пул, на який OpenRouter може перемкнутися. Помилки парсера повертаються сирою розміткою, тож парсити доводиться на своєму боці. Збої ховаються й за кодами успіху: модель може віддати HTTP 200 з content: null і finish_reason «stop» після 345 токенів, а деякі ендпоінти не повертають навіть об'єкта usage. У липні StreamLake дав близько 20% трафіку на DeepSeek і 92% порожніх відповідей.

Правила історії, тестування й пінінг

Контракт залежить від постачальника, а не від моделі: SiliconFlow повертає 400 з кодом 20015, коли історія режиму мислення надходить із порожнім reasoning, а Baidu, Alibaba і Cloudflare приймають ту саму історію. Тестувати треба з продакшену, а не з ноутбука: Venice і Novita працювали з Mac Мустафи, але майже кожен запит з його інфраструктури в ту саму хвилину й з тим самим ключем отримав 429. Пінінг теж не гарантія: із закріпленими cloudflare, baidu та alibaba і вимкненими фолбеками всі три зрештою відмовили, і топова модель OpenRouter лягла разом з Olly.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.