Отже, хочете користуватися OpenRouter? Уроки 18 мільйонів повідомлень
Автор асистента для iMessage пояснює, чому та сама відкрита модель поводиться по-різному в кожного постачальника: розриви в бенчмарках на 20 пунктів, «сліпі» зорові ендпоінти та порожні відповіді 200 OK.
Модель і постачальник — не одне й те саме
Мо Мустафа, автор Olly — ШІ-асистента, що живе в iMessage, — опублікував практичний путівник OpenRouter. Olly обробив понад 18 мільйонів повідомлень, приблизно третина з них — на відкритих моделях через цей сервіс; такий обсяг, за його словами, гарантує, що кожен крайовий випадок трапиться хоч раз. Термінологія автора пряма: модель — це ваги, а постачальник — це той, до кого OpenRouter вас спрямовує: він розміщує ваги на власних GPU, з власною точністю та власними парсерами, а отже, має власний список помилок. Запитуючи deepseek/deepseek-v4-flash, ви отримуєте одну з приблизно 20 компаній. «На папері це та сама модель, у реальності — геть різні».
Бенчмарки, зір і параметр effort
OpenRouter публікує бенчмарки для кожного постачальника на однакових вагах. У таблиці для DeepSeek V4 Flash 0731 від 7 вересня первинний DeepSeek має 90% на GPQA Diamond і 81% на TAU-Bench Airline (завдання з виклику інструментів), тоді як DigitalOcean — 75% і 58%. Більшість хостів відстають від первинного на 5–7 пунктів у виклику інструментів, а чотири провалюються в знаннях; у липні Fireworks мав 46% на TAU, тобто розрив у 30 пунктів. Зір не рівніший: під час тесту з трьома маленькими зображеннями Qwen-ендпоінт DeepInfra прочитав K як R, назвав червоне синім і описав слово «umbrella» як «funny», тоді як чотири інші хости з тими самими вагами розпізнали все правильно; Venice і Together взагалі не побачили зображення MiniMax, але все одно відповіли 200 OK. Параметр reasoning.effort приймається всюди, проте його дотримуються не всі: digitalocean, gmi-cloud, mancer і venice його фактично ігнорують.
Квантизація, парсинг і порожні відповіді
Фільтр за заявленою точністю якості не дає. Після місяця роботи з фільтром fp8 на DeepSeek хости fp4 опинилися в середині групи fp8, а три найгірші результати GPQA припали на один хост fp4, один fp8 і один, що не декларує нічого; на GLM найкращий результат узагалі не має декларації. Точність — поганий показник якості, а жорсткий фільтр ще й звужує пул, на який OpenRouter може перемкнутися. Помилки парсера повертаються сирою розміткою, тож парсити доводиться на своєму боці. Збої ховаються й за кодами успіху: модель може віддати HTTP 200 з content: null і finish_reason «stop» після 345 токенів, а деякі ендпоінти не повертають навіть об'єкта usage. У липні StreamLake дав близько 20% трафіку на DeepSeek і 92% порожніх відповідей.
Правила історії, тестування й пінінг
Контракт залежить від постачальника, а не від моделі: SiliconFlow повертає 400 з кодом 20015, коли історія режиму мислення надходить із порожнім reasoning, а Baidu, Alibaba і Cloudflare приймають ту саму історію. Тестувати треба з продакшену, а не з ноутбука: Venice і Novita працювали з Mac Мустафи, але майже кожен запит з його інфраструктури в ту саму хвилину й з тим самим ключем отримав 429. Пінінг теж не гарантія: із закріпленими cloudflare, baidu та alibaba і вимкненими фолбеками всі три зрештою відмовили, і топова модель OpenRouter лягла разом з Olly.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.