უკან დაბრუნება
SiTech
OpenRouter-ის გამოყენება: გაკვეთილები 18 მილიონი შეტყობინებიდან
SiTech AI Team2 წთ. საკითხავი

OpenRouter-ის გამოყენება: გაკვეთილები 18 მილიონი შეტყობინებიდან

Olly-ს ავტორმა OpenRouter-ის ხარვეზები აღწერა: ერთი და იგივე წონები პროვაიდერების მიხედვით 20 ქულით განსხვავებულ შედეგს იძლევა, ხედვაც და effort-ის პარამეტრიც არათანაბრად მუშაობს, 200 OK კი ცარიელ პასუხსაც ნიშნავს.

მოდელი და პროვაიდერი ერთი და იგივე არ არის

Mo Moustafa, iMessage-ში მცხოვრები AI ასისტენტ Olly-ს ავტორი, OpenRouter-ის პრაქტიკულ სახელმძღვანელოს აქვეყნებს. Olly-მ ჯამში 18 მილიონზე მეტი შეტყობინება დაამუშავა, მათგან დაახლოებით მესამედი სწორედ OpenRouter-ის გავლით, ღია მოდელებზე — ეს ისეთი მოცულობაა, რომ ყველა კიდური შემთხვევა ერთხელ მაინც გამოჩნდება. ავტორის ტერმინოლოგია მკაფიოა: მოდელი წონებია, პროვაიდერი კი ის კომპანიაა, რომელთანაც OpenRouter მოგამისამართებთ — ისინი წონებს საკუთარ GPU-ებზე, თავიანთი სიზუსტითა და საკუთარი პარსერებით მასპინძლობენ, შესაბამისად, საკუთარი ხარვეზების სიაც აქვთ. deepseek/deepseek-v4-flash-ის მოთხოვნისას დაახლოებით 20 კომპანიიდან ერთ-ერთს მიიღებთ. „ქაღალდზე ერთი და იგივე მოდელია, რეალურ ცხოვრებაში კი — სულ სხვადასხვა."

ბენჩმარკები, ხედვა და effort-ის პარამეტრი

OpenRouter იდენტური წონებისთვის თითოეული პროვაიდერის ბენჩმარკებს აქვეყნებს. 7 სექტემბრის ცხრილში DeepSeek V4 Flash 0731-ისთვის პირველადი DeepSeek-ის შედეგია 90% GPQA Diamond-ზე და 81% TAU-Bench Airline-ზე (ხელსაწყოების გამოძახების ტესტი), DigitalOcean-ისა კი — 75% და 58%. პროვაიდერების უმეტესობა პირველადზე 5-7 ქულით ჩამორჩება, ოთხს კი ცოდნის ნაწილში უფსკრული აქვს. ხედვის შემთხვევაშიც მსგავსი სურათია: სამი პატარა სურათის გატესტვისას DeepInfra-ს Qwen K-ს R-ად წაიკითხა, წითელს ლურჯი უწოდა და სიტყვა „umbrella" „სასაცილოდ" აღწერა, ხოლო იმავე წონების ოთხმა სხვა ჰოსტმა ყველაფერი სწორად ამოიცნო; Venice-მა და Together-მა MiniMax-ის სურათები საერთოდ ვერ დაინახეს, პასუხად კი მაინც 200 OK დაბრუნდა. reasoning.effort ყველგან მიიღება, მაგრამ ყველგან არ მუშაობს: digitalocean, gmi-cloud, mancer და venice პრაქტიკულად უგულებელყოფენ.

კვანტიზაცია, პარსინგი და ცარიელი პასუხები

დეკლარირებული სიზუსტით ფილტრაცია ხარისხს არ იძლევა: DeepSeek-ზე fp8 ფილტრის ერთთვიანი გამოყენების შემდეგ fp4 ჰოსტები fp8 ჯგუფის შუაში აღმოჩნდნენ, სამი ყველაზე ცუდი GPQA შედეგი კი ერთი fp4, ერთი fp8 და ერთი „არაფრის დეკლარირების" მქონე ჰოსტს ეკუთვნოდა; GLM-ზე საუკეთესო შემდეგ კონკრეტულად არაფერს აცხადებს. სიზუსტე ხარისხის ცუდი მაჩვენებელია, მკაცრი ფილტრი კი ამცირებს იმ აუზს, სადაც OpenRouter-ს გადართვა შეუძლია. პარსერის გამოტოვებები ნედლ მარკაპად ბრუნდება, ამიტომ დეველოპერს თავად უწევს პასუხის დამუშავება. წარუმატებლობა წარმატების კოდებსაც ემალება: reasoning-მოდელს შეუძლია დააბრუნოს HTTP 200, content: null და finish_reason „stop" 345 კომპლეშენ-ტოკენის შემდეგ, ზოგიერთი endpoint კი usage ობიექტის გარეშე პასუხობს. ივლისში StreamLake-მა DeepSeek-ზე ტრაფიკის დაახლოებით 20% და ცარიელი პასუხების 92% შეადგინა.

ისტორიის წესები, ტესტირება და პროვაიდერის დამაგრება

კონტრაქტი მოდელზე კი არა, პროვაიდერზეა დამოკიდებული: SiliconFlow 400-ს აბრუნებს კოდით 20015, როცა thinking რეჟიმის ისტორია ცარიელი reasoning-ით ბრუნდება, Baidu, Alibaba და Cloudflare კი იმავე ისტორიას უპრობლემოდ იღებენ. ტესტირება საწარმოო გარემოდან და არა ლეპტოპიდანაა საჭირო: Venice და Novita Moustafa-ს Mac-იდან მუშაობდნენ, იმავე წუთსა და იმავე გასაღებით ინფრასტრუქტურიდან თითქმის ყველა მოთხოვნაზე 429 დაბრუნდა. პროვაიდერის დამაგრება დაზღვევა არც არის: cloudflare, baidu და alibaba-ს დამაგრებისას სამივე საბოლოოდ ჩავარდა, OpenRouter-ის ტოპ მოდელი კი Olly-სთან ერთად გათიშულად დარჩა.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.