Ուզո՞ւմ եք օգտվել OpenRouter-ից. դասեր 18 միլիոն հաղորդագրությունից
iMessage-ի օգնականի հեղինակը բացատրում է, թե ինչու նույն բաց մոդելը տարբեր մատակարարների մոտ տարբեր կերպ է վարվում. 20 միավորի տարբերություն բենչմարքներում, «կույր» տեսողական endpoint-ներ և դատարկ 200 OK պատասխաններ։
Մոդելը և մատակարարը նույնը չեն
Mo Moustafa-ն, ով վարում է iMessage-ում ապրող Olly AI օգնականը, հրապարակել է OpenRouter-ի գործնական ուղեցույց։ Olly-ն մշակել է 18 միլիոնից ավելի հաղորդագրություն, որոնց մոտ մեկ երրորդը բաց մոդելներով՝ այս ծառայության միջոցով։ Նրա ձևակերպումները հստակ են. մոդելը կշիռներն են, իսկ մատակարարը նա է, ում OpenRouter-ը ձեզ ուղղում է. նա կշիռները տեղադրում է սեփական GPU-ներում՝ իր ընտրած ճշգրտությամբ և սեփական պարսերներով, հետևաբար ունի նաև սեփական սխալների ցանկ։ deepseek/deepseek-v4-flash հարցնելիս ստանում եք մոտ 20 ընկերություններից մեկին։ «Թղթի վրա նույն մոդելն է, իրականում՝ բոլորովին տարբեր»։
Բենչմարքներ, տեսողություն և effort պարամետրը
OpenRouter-ը նույն կշիռների համար հրապարակում է մատակարարների բենչմարքներ։ Սեպտեմբերի 7-ի DeepSeek V4 Flash 0731 աղյուսակում առաջին կողմի DeepSeek-ը ստացել է 90% GPQA Diamond-ում և 81% TAU-Bench Airline-ում (գործիք կանչելու առաջադրանք), իսկ DigitalOcean-ը՝ 75% և 58%։ Մատակարարների մեծ մասը գործիք կանչելիս 5-7 միավոր զիջում է առաջին կողմին, չորսը՝ կտրուկ ընկնում գիտելիքի հատվածում. հուլիսին Fireworks-ը TAU-ում ստացել էր 46%, այսինքն՝ 30 միավորի տարբերություն։ Տեսողությունը նույնպես անհավասար է. երեք փոքր պատկեր ուղարկելով երկու բաց տեսողական մոդելների բոլոր հոսթերին՝ DeepInfra-ի Qwen endpoint-ը K-ն կարդաց որպես R, կարմիրը անվանեց կապույտ և «umbrella» բառը նկարագրեց որպես «funny», մինչդեռ նույն կշիռներով չորս այլ հոսթեր ամեն ինչ ճիշտ ընկալեցին. Venice-ը և Together-ը MiniMax-ի պատկերները ընդհանրապես չտեսան, բայց պատասխանեցին 200 OK։ reasoning.effort-ը ընդունվում է ամենուր, սակայն պահպանվում է ոչ ամենուր. digitalocean, gmi-cloud, mancer և venice գործնականում անտեսում են այն։
Քվանտացում, պարսինգ և դատարկ պատասխաններ
Հայտարարված ճշգրտությամբ ֆիլտրելը որակ չի ապահովում. DeepSeek-ում fp8 ֆիլտրի մեկ ամիս օգտագործելուց հետո fp4 հոսթերը հայտնվեցին fp8 խմբի մեջտեղում, իսկ ամենավատ երեք GPQA արդյունքները պատկանում էին մեկ fp4, մեկ fp8 և մեկ ոչինչ չհայտարարող հոսթի. GLM-ում երկու աղյուսակների լավագույնը ոչինչ չի հայտարարում։ Ճշգրտությունը որակի վատ ցուցիչ է, կոշտ ֆիլտրը նաև նեղացնում է այն պաշարը, որտեղ OpenRouter-ը կարող է անցնել։ Պարսերի բացթողումները վերադառնում են որպես հում նշագրում, ուստի մշակողը ստիպված է ինքը մշակել պատասխանը։ Ձախողումները թաքնվում են նաև հաջողության կոդերի հետևում. reasoning մոդելը կարող է վերադարձնել HTTP 200՝ content: null և finish_reason «stop» 345 թոքենից հետո, իսկ որոշ endpoint-ներ ընդհանրապես usage օբյեկտ չեն տալիս։ Հուլիսին StreamLake-ը կազմել է DeepSeek-ի նրա թրաֆիկի մոտ 20%-ը և դատարկ պատասխանների 92%-ը։
Պատմության կանոնները, թեստավորումը և ամրացումը
Պայմանագիրը մոդելի կողմից չէ, այլ մատակարարի. SiliconFlow-ը վերադարձնում է 400՝ 20015 կոդով, երբ thinking ռեժիմի պատմությունը գալիս է դատարկ reasoning-ով, իսկ Baidu-ն, Alibaba-ն և Cloudflare-ը ընդունում են նույն պատմությունը։ Թեստավորել պետք է արտադրական միջավայրից, ոչ թե նոութբուքից. Venice-ն և Novita-ն աշխատում էին Moustafa-ի Mac-ից, սակայն նրա ենթակառուցվածքից գրեթե բոլոր հարցումները նույն րոպեին և նույն բանալիով ստացան 429։ Մատակարարին ամրացնելը նույնպես անվտանգություն չէ. cloudflare, baidu և alibaba ամրացված և fallback-ները անջատված վիճակում վերջում երեքն էլ ձախողվեցին, և OpenRouter-ի լավագույն մոդելն ընկավ Olly-ի հետ միասին։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։