חזרה
SiTech
אז אתם רוצים להשתמש ב-OpenRouter? לקחים מ-18 מיליון הודעות
SiTech AI Team3 წთ. საკითხავი

אז אתם רוצים להשתמש ב-OpenRouter? לקחים מ-18 מיליון הודעות

מחברו של עוזר ל-iMessage מסביר מדוע אותו מודל פתוח מתנהג אחרת אצל כל ספק: פערים של 20 נקודות בבנצ'מרקים, נקודות קצה עיוורות לראייה ותשובות 200 OK חלולות. הניתוח מבוסס על 18 מיליון הודעות של העוזר Olly.

המודל אינו הספק

מו מוסטפא, שמפעיל את Olly — עוזר AI שחי ב-iMessage — פרסם מדריך מעשי ל-OpenRouter.‏ Olly עיבד יותר מ-18 מיליון הודעות, כשליש מהן על מודלים פתוחים דרך השירות; זה נפח שמבטיח, לדבריו, שכל מקרה קצה יקרה לפחות פעם אחת. המינוח שלו חד: המודל הוא המשקלים, והספק הוא זה ש-OpenRouter מנתב אליו — הוא מארח את אותם משקלים על ה-GPU שלו, ברמת הדיוק שבחר, עם הפרסרים שלו, ולכן גם עם רשימת הבאגים שלו. בקשה ל-deepseek/deepseek-v4-flash מחזירה אחת מכ-20 חברות. "אותו מודל על הנייר, מודלים שונים לגמרי במציאות".

בנצ'מרקים, ראייה ומתג ה-effort

OpenRouter מפרסמת בנצ'מרקים לפי ספק על אותם משקלים. בלוח של DeepSeek V4 Flash 0731 מ-7 בספטמבר קיבל DeepSeek המקורי 90% ב-GPQA Diamond ו-81% ב-TAU-Bench Airline (משימת קריאה לכלים), ואילו DigitalOcean קיבל 75% ו-58%. רוב המארחים נמוכים ב-5 עד 7 נקודות מהמקור בקריאה לכלים, וארבעה צונחים בידע; ביולי קיבל Fireworks ‏46% ב-TAU, פער של 30 נקודות. גם הראייה לא אחידה: בשליחת שלוש תמונות קטנות לכל מארח של שני מודלי ראייה פתוחים, נקודת הקצה Qwen של DeepInfra קראה K כ-R, כינתה אדום כחול ותיארה את המילה "umbrella" כ"funny", בעוד ארבעה מארחים אחרים עם אותם משקלים זיהו הכול נכון; Venice ו-Together לא ראו כלל את תמונות MiniMax ובכל זאת השיבו 200 OK. גם reasoning.effort מתקבל בכל מקום אך לא מכובד בכל מקום: digitalocean, gmi-cloud, mancer ו-venice מתעלמים ממנו כמעט לחלוטין.

קוונטיזציה, פרסור ותשובות חלולות

סינון לפי דיוק מוצהר לא קונה איכות. אחרי חודש של הרצת מסנן fp8 על DeepSeek נחתו מארחי fp4 באמצע חבילת ה-fp8, ושלושת ציוני ה-GPQA הגרועים ביותר היו של מארח fp4, מארח fp8 ואחד שלא מצהיר על דבר; ב-GLM המצטיין בשני הלוחות דווקא לא מצהיר על דבר. דיוק הוא מדד גרוע לאיכות, ומסנן קשיח גם מקטין את המאגר שאליו OpenRouter יכולה לסגת. פספוסי פרסור חוזרים כסימון גולמי בתשובה, ולכן הפרסור עובר לצד של המפתח. גם כשלים מסתתרים מאחורי קודי הצלחה: מודל חשיבה יכול להחזיר HTTP 200 עם content: null ו-finish_reason "stop" אחרי 345 טוקנים, וחלק מנקודות הקצה לא מחזירות כלל אובייקט usage. ביולי היווה StreamLake כ-20% מהתעבורה שלו ל-DeepSeek וכ-92% מהתשובות החלולות.

חוקי ההיסטוריה, בדיקות ונעיצה

החוזה הוא לפי ספק, לא לפי מודל: SiliconFlow מחזיר 400 עם קוד 20015 כשההיסטוריה של מצב החשיבה נשלחת עם reasoning ריק, בעוד Baidu, Alibaba ו-Cloudflare מקבלים את אותה היסטוריה. יש לבדוק מהפרודקשן ולא מהמחשב הנייד: Venice ו-Novita עבדו מהמק של מוסטפא, אבל כמעט כל בדיקה מהתשתית שלו באותה דקה ובאותו מפתח קיבלה 429. גם נעיצת ספקים אינה ביטחון: עם cloudflare, baidu ו-alibaba נעולים וללא גיבוי, כולם נכשלו בסוף, והמודל המוביל ב-OpenRouter נפל יחד עם Olly.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.