Geri Dön
SiTech
OpenRouter kullanmak mı istiyorsunuz? 18 milyon mesajdan dersler
SiTech AI Team3 წთ. საკითხავი

OpenRouter kullanmak mı istiyorsunuz? 18 milyon mesajdan dersler

Bir iMessage asistanının yazarı, aynı açık modelin neden her sağlayıcıda farklı davrandığını anlatıyor: 20 puana varan kıyaslama farkları, kör görü uç noktaları ve boş 200 OK yanıtları.

Model ile sağlayıcı aynı şey değil

iMessage içinde yaşayan Olly adlı asistanı işleten Mo Moustafa, OpenRouter için pratik bir rehber yayımladı. Olly toplamda 18 milyondan fazla mesaj işledi; bunların yaklaşık üçte biri bu hizmet üzerinden açık modellerde geçti. Ona göre bu hacim, her uç durumun en az bir kez yaşanması için yeterli. Terminolojisi net: model ağırlıklardır, sağlayıcı ise OpenRouter'ın sizi yönlendirdiği şirkettir; ağırlıkları kendi GPU'larında, seçtiği hassasiyette ve kendi ayrıştırıcılarıyla barındırır, dolayısıyla kendi hata listesine de sahiptir. deepseek/deepseek-v4-flash istediğinizde yaklaşık 20 şirketten birini alırsınız. "Kâğıt üzerinde aynı model, gerçekte çok farklı modeller."

Kıyaslamalar, görü ve effort ayarı

OpenRouter aynı ağırlıklar için sağlayıcı bazlı kıyaslamalar yayımlıyor. 7 Eylül tarihli DeepSeek V4 Flash 0731 tablosunda birinci taraf DeepSeek, GPQA Diamond'da %90 ve bir araç çağırma görevi olan TAU-Bench Airline'da %81 alırken DigitalOcean aynı ağırlıklarla %75 ve %58 aldı. Çoğu sunucu araç çağırmada birinci tarafın 5-7 puan altında kalıyor, dördü ise bilgi testinde uçurum yaşıyor; temmuzda Fireworks TAU'da %46 ile 30 puanlık bir fark yaratmıştı. Görü de aynı derecede düzensiz: üç küçük görseli iki açık görü modelinin tüm sunucularına gönderen Moustafa, DeepInfra'nın Qwen uç noktasının K harfini R olarak okuduğunu, kırmızıya mavi dediğini ve "umbrella" kelimesini "funny" olarak tanımladığını gördü; aynı ağırlıklara sahip dört başka sunucu her şeyi doğru bildi. Venice ve Together MiniMax görsellerini hiç görmedi, buna rağmen 200 OK döndü. reasoning.effort her yerde kabul ediliyor ama her yerde uygulanmıyor: digitalocean, gmi-cloud, mancer ve venice onu büyük ölçüde yok sayıyor.

Nicemleme, ayrıştırma ve boş yanıtlar

Beyan edilen hassasiyete göre filtrelemek kalite getirmiyor. DeepSeek'te bir ay boyunca fp8 filtresi kullanıldığında fp4 sunucuları fp8 grubunun ortasına yerleşti; en kötü üç GPQA skoru bir fp4, bir fp8 ve hiçbir şey beyan etmeyen bir sunucuya aitti; GLM'de her iki tablonun en iyisi hiçbir beyanda bulunmuyor. Hassasiyet kalitenin kötü göstergesi, katı filtre ise OpenRouter'ın dönebileceği havuzu daraltıyor. Ayrıştırıcı kaçırmaları yanıtta ham işaretleme olarak dönüyor, bu yüzden ayrıştırma geliştirici tarafına taşınıyor. Hatalar başarı kodlarının arkasına da saklanıyor: bir akıl yürütme modeli 345 token sonrasında HTTP 200 ile content: null ve finish_reason "stop" döndürebiliyor, bazı uç noktalar usage nesnesini hiç vermiyor. Temmuzda StreamLake, DeepSeek trafiğinin yaklaşık %20'sini ve boş yanıtlarının %92'sini oluşturdu.

Geçmiş kuralları, test ve sabitleme

Sözleşme modele değil sağlayıcıya bağlı: SiliconFlow, düşünme modu geçmişi boş reasoning ile geri gönderildiğinde 20015 koduyla 400 döndürüyor; Baidu, Alibaba ve Cloudflare aynı geçmişi kabul ediyor. Testler dizüstünden değil üretim ortamından yapılmalı: Venice ve Novita Moustafa'nın Mac'inde çalıştı, ancak altyapısından gelen neredeyse tüm istekler aynı dakikada ve aynı anahtarla 429 aldı. Sağlayıcıyı sabitlemek de güvence değil: cloudflare, baidu ve alibaba sabitlenip yedekler kapatıldığında üçü de sonunda çöktü ve OpenRouter'ın en üst modeli Olly ile birlikte düştü.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.