
Qwen 3.8 27B Cerebras-ın açıq endpointlərində: saniyədə ~1850 token
Cerebras kataloquna Alibaba-nın 27B sıx multimodallı Qwen 3.8 27B modelini əlavə edib: 64K/128K kontekst, milyon giriş tokeni üçün 0,99 dollar və açıq endpointlərdə saniyədə təxminən 1850 token.
Cerebras indi Qwen 3.8 27B-ni özünün açıq inferens endpointlərində təqdim olunan modellər sırasında göstərir. Alibaba-nın 27 milyard parametrli modeli şirkətin Model Kataloqunda OpenAI-ın gpt-oss-120b modeli ilə yanaşı dayanır və saniyədə təxminən 1850 token sürəti ilə göstərilir.
Kataloqda nələr var
Model ID-si qwen-3.8-27b-dir. Cerebras onu agent əsaslı kodlaşdırma, alət istifadəsi, tədqiqat və uzunmüddətli iş axınları üçün Alibaba-nın 27B sıx (dense) multimodallı modeli kimi təsvir edir: mətn və şəkil girişi qəbul edir, konfiqurasiya edilə bilən mühakiməni dəstəkləyir. Kontekst pəncərəsi pulsuz sınaq səviyyəsində 64K token (65 536), ödənişli səviyyələrdə 128K token (131 072); maksimal çıxış isə uyğun olaraq 32K (32 768) və 40K (40 960) tokendir. Qiymət: milyon giriş tokeni üçün 0,99 dollar və milyon çıxış tokeni üçün 1,49 dollar. Müqayisə üçün həmin kataloqda gpt-oss-120b 120 milyard parametr, 65k/131k kontekst və saniyədə təxminən 3000 tokenlə göstərilir.
Sürət limitləri və imkanlar
Pulsuz sınaq səviyyəsində limitlər dəqiqədə 5 sorğu, dəqiqədə 30K giriş tokeni, dəqiqədə cəmi 90K token, gündə 1 milyon token və sorğu başına 2 şəklə qədərdir. Developer səviyyəsi dəqiqədə 300 sorğuya, dəqiqədə 150K giriş və 450K ümumi tokenə, sorğu başına 10 şəklə qədər imkan verir; gündəlik token həddi göstərilmir. Dəstəklənən funksiyalara şəkil girişi, mühakimə, striminqlər, seçmə parametrləri, strukturlaşdırılmış çıxış, alət çağırma, paralel alət çağırma və prompt keşləmə daxildir. İki endpoint mövcuddur: Chat Completions və Completions.
Bilməyə dəyər məhdudiyyətlər
Mühakimə standart olaraq "high" səviyyəsində aktivdir və reasoning_effort dəyərini none etməklə söndürülə bilər. Şəkil girişi yalnız Chat Completions vasitəsilə və base64 ilə kodlanmış PNG və ya JPEG kimi işləyir; xarici şəkil keçidləri, detallılıq nəzarəti, şəkil generasiyası, video və audio dəstəklənmir. Completions endpointi yalnız mətn qaytarır və şəkilləri, mühakimə nəzarətini, strukturlaşdırılmış söhbət mesajlarını və alətləri dəstəkləmir.
Kəsilməmiş modellər və sıxılma
Sənədlərdə qeyd olunur ki, açıq endpointlərdəki bütün modellər orijinal, kəsilməmiş versiyalardır. Çəkilərin kvantlaşdırılması seçici şəkildə və yalnız saxlama üçün tətbiq olunur — 16, 8 və 4 bit aralığında; həssas qatlar tam dəqiqliklə saxlanılır və dekvantlaşdırma işləmə zamanı aparılır, aktivasiyalar, diqqət mexanizmi və KV keşi isə tam kvantlaşdırılmamış qalır. Şirkətin tədqiq etdiyi REAP üsulu ilə kəsilmiş modellər Hugging Face-də dərc olunur, amma API vasitəsilə təqdim edilmir. Cerebras mövcud modelin arxitekturasını xəbərdarlıq etmədən dəyişməyəcəyini və gələcək kəsimlərin ayrı, adı aydın endpointlər kimi təklif olunacağını bildirir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.