Geri Dön
Qwen 3.8 27B, Cerebras'ın genel uç noktalarında: saniyede ~1.850 token
SiTech AI Team2 წთ. საკითხავი

Qwen 3.8 27B, Cerebras'ın genel uç noktalarında: saniyede ~1.850 token

Cerebras, Alibaba'nın 27B yoğun çok kipli modeli Qwen 3.8 27B'yi kataloğuna ekledi: 64K/128K bağlam penceresi, milyon girdi tokenı başına 0,99 dolar ve genel uç noktalarda saniyede yaklaşık 1.850 token.

Cerebras artık Qwen 3.8 27B'yi genel çıkarım uç noktalarında sunulan modeller arasında gösteriyor. Alibaba'nın 27 milyar parametreli modeli, şirketin Model Kataloğu'nda OpenAI'ın gpt-oss-120b modelinin yanında yer alıyor ve yaklaşık saniyede 1.850 token hızıyla listeleniyor.

Katalogda neler var

Model kimliği qwen-3.8-27b. Cerebras onu ajan tabanlı kodlama, araç kullanımı, araştırma ve uzun süren iş akışları için 27B yoğun (dense) çok kipli model olarak tanımlıyor: metin ve görüntü girdisi alıyor, yapılandırılabilir akıl yürütmeyi destekliyor. Bağlam penceresi ücretsiz deneme katmanında 64K token (65.536), ücretli katmanlarda 128K token (131.072); en fazla çıktı ise sırasıyla 32K (32.768) ve 40K (40.960) token. Fiyatlar milyon girdi tokenı başına 0,99 dolar ve milyon çıktı tokenı başına 1,49 dolar olarak veriliyor. Karşılaştırma için aynı katalogda gpt-oss-120b 120 milyar parametre, 65k/131k bağlam ve saniyede yaklaşık 3.000 token ile listeleniyor.

Hız sınırları ve yetenekler

Ücretsiz deneme katmanında sınırlar dakikada 5 istek, dakikada 30K girdi tokenı, dakikada toplam 90K token, günde 1 milyon token ve istek başına en fazla 2 görüntü. Developer katmanı dakikada 300 istek, dakikada 150K girdi tokenı ve toplam 450K token, istek başına en fazla 10 görüntü sağlıyor; günlük token üst sınırı belirtilmiyor. Desteklenen özellikler arasında görüntü girdisi, akıl yürütme, akış (streaming), örnekleme kontrolleri, yapılandırılmış çıktı, araç çağırma, paralel araç çağırma ve istem önbellekleme var. İki uç nokta sunuluyor: Chat Completions ve Completions.

Bilinmesi gereken sınırlamalar

Akıl yürütme varsayılan olarak "high" düzeyinde açık ve reasoning_effort değeri none yapılarak kapatılabiliyor. Görüntü girdisi yalnızca Chat Completions üzerinden ve base64 ile kodlanmış PNG ya da JPEG verisi olarak çalışıyor; harici görüntü bağlantıları, ayrıntı düzeyi denetimi, görüntü üretimi, video ve ses desteklenmiyor. Completions uç noktası yalnızca metin döndürüyor; görüntüleri, akıl yürütme denetimlerini, yapılandırılmış sohbet mesajlarını ve araçları desteklemiyor.

Kırpılmamış modeller ve sıkıştırma

Belgeler, genel uç noktalardaki tüm modellerin özgün ve kırpılmamış sürümler olduğunu belirtiyor. Ağırlık nicemlemesi seçici ve yalnızca depolama için kullanılıyor; 16, 8 ve 4 bit aralığında. Hassas katmanlar tam duyarlılıkta saklanıyor ve nicem çözme çalışma anında yapılıyor; aktivasyonlar, dikkat mekanizması ve KV önbelleği ise hiç nicemlenmeden kalıyor. Şirketin araştırdığı REAP yöntemiyle kırpılmış modeller Hugging Face'te yayımlanıyor ama API üzerinden sunulmuyor. Cerebras, mevcut bir modelin mimarisini haber vermeden değiştirmeyeceğini ve ileride yapılacak kırpmanın ayrı, adı açık uç noktalar olarak sunulacağını bildiriyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.