OpenRouter-dən istifadə etmək istəyirsiniz? 18 milyon mesajdan dərslər
iMessage köməkçisinin müəllifi izah edir ki, niyə eyni açıq model hər təchizatçıda fərqli davranır: müqayisələrdə 20 bala çatan fərqlər, kor görmə endpointləri və boş 200 OK cavabları.
Model təchizatçı deyil
iMessage daxilində yaşayan Olly AI köməkçisini idarə edən Mo Moustafa OpenRouter üçün praktik bələdçi dərc edib. Olly indiyədək 18 milyondan çox mesaj emal edib; bunların təqribən üçdə biri bu xidmət vasitəsilə açıq modellərdə olub. Bu həcm, onun sözlərinə görə, hər kənar halın ən azı bir dəfə baş verməsi üçün kifayətdir. Terminologiya aydındır: model çəkilərdir, təchizatçı isə OpenRouter-ın sizi yönləndirdiyi şirkətdir — o, çəkiləri öz GPU-larında, seçdiyi dəqiqliklə və öz parserləri ilə yerləşdirir, deməli, öz səhvlər siyahısına da malikdir. deepseek/deepseek-v4-flash soruşduqda təqribən 20 şirkətdən birini alırsınız. "Kağızda eyni model, real həyatda tamamilə fərqli modellər."
Müqayisələr, görmə və effort düyməsi
OpenRouter eyni çəkilər üçün təchizatçı üzrə müqayisələr dərc edir. 7 sentyabr tarixli DeepSeek V4 Flash 0731 lövhəsində birinci tərəf DeepSeek GPQA Diamond-da 90%, alət çağırma tapşırığı olan TAU-Bench Airline-da isə 81% toplayıb; DigitalOcean isə eyni çəkilərlə 75% və 58% alıb. Hostların çoxu alət çağırma üzrə birinci tərəfdən 5-7 bal geri qalır, dördü isə bilik bölməsində uçurum yaşayır; iyulda Fireworks TAU-da 46% toplayıb, 30 ballıq fərq yaradıb. Görmə də eyni dərəcədə qeyri-bərabərdir: üç kiçik şəkli iki açıq görmə modelinin bütün hostlarına göndərən Moustafa gördü ki, DeepInfra-nın Qwen endpointi K hərfini R kimi oxuyub, qırmızıya mavi deyib və "umbrella" sözünü "funny" kimi təsvir edib; eyni çəkilərlə dörd başqa host isə hər şeyi düzgün tanıyıb. Venice və Together MiniMax şəkillərini ümumiyyətlə görməyib, amma yenə də 200 OK qaytarıb. reasoning.effort hər yerdə qəbul edilir, amma hər yerdə tətbiq olunmur: digitalocean, gmi-cloud, mancer və venice onu praktiki olaraq görməzlikdən gəlir.
Kvantlaşdırma, pars və boş cavablar
Bəyan edilən dəqiqliyə görə filtrləmə keyfiyyət gətirmir. DeepSeek-də bir ay fp8 filtrindən istifadə etdikdən sonra fp4 hostları fp8 qrupunun ortasında yerləşdi, ən pis üç GPQA nəticəsi isə bir fp4, bir fp8 və heç nə bəyan etməyən hosta aid idi; GLM-də hər iki lövhənin ən yaxşısı heç nə bəyan etmir. Dəqiqlik keyfiyyətin pis göstəricisidir, sərt filtr isə OpenRouter-ın dönə biləcəyi hovuzu daraldır. Pars buraxmaları cavabda xam işarələmə kimi qayıdır, ona görə də emalı inkişaf etdirici tərəfinə keçirmək lazımdır. Uğursuzluqlar uğur kodlarının arxasında da gizlənir: reasoning modeli 345 tokendən sonra HTTP 200, content: null və finish_reason "stop" qaytara bilər, bəzi endpointlər isə usage obyektini heç vermir. İyulda StreamLake DeepSeek trafikinin təqribən 20%-ni və boş cavabların 92%-ni təşkil edib.
Tarixçə qaydaları, test və sabitləmə
Müqavilə modelə deyil, təchizatçıya bağlıdır: SiliconFlow thinking rejiminin tarixçəsi boş reasoning ilə qayıtdıqda 20015 kodu ilə 400 qaytarır, Baidu, Alibaba və Cloudflare isə eyni tarixçəni qəbul edir. Testlər noutbukdan deyil, istehsalat mühitindən aparılmalıdır: Venice və Novita Moustafanın Mac-ində işləyirdi, lakin onun infrastrukturundan gələn demək olar ki, bütün sorğular eyni dəqiqədə və eyni açarla 429 aldı. Təchizatçını sabitləmək də təminat deyil: cloudflare, baidu və alibaba sabitlənib ehtiyat variantlar söndürüldükdə üçü də sonda sıradan çıxdı və OpenRouter-ın ən yaxşı modeli Olly ilə birlikdə düşdü.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.