חזרה
Qwen 3.8 27B בנקודות הקצה הציבוריות של Cerebras: כ־1,850 טוקנים בשנייה
SiTech AI Team2 წთ. საკითხავი

Qwen 3.8 27B בנקודות הקצה הציבוריות של Cerebras: כ־1,850 טוקנים בשנייה

Cerebras הוסיפה לקטלוג את המודל המולטימודלי Qwen 3.8 27B של Alibaba: חלון הקשר 64K/128K, 0.99 דולר למיליון טוקני קלט וכ־1,850 טוקנים בשנייה בנקודות קצה ציבוריות.

Cerebras מציינת כעת את Qwen 3.8 27B בין המודלים המוגשים בנקודות הקצה הציבוריות שלה. המודל של Alibaba עם 27 מיליארד פרמטרים מופיע לצד gpt-oss-120b של OpenAI בקטלוג המודלים של החברה, שם הוא מוצג במהירות של כ־1,850 טוקנים בשנייה.

מה מופיע בקטלוג

מזהה המודל הוא qwen-3.8-27b. Cerebras מתארת אותו כמודל dense מולטימודלי של Alibaba עם 27 מיליארד פרמטרים, לקידוד סוכני, שימוש בכלים, מחקר ותהליכי עבודה ארוכים: הוא מקבל טקסט ותמונות ותומך בהסקה ניתנת להגדרה. חלון ההקשר הוא 64K טוקנים (65,536) במסלול הניסיון החינמי ו־128K טוקנים (131,072) במסלולים בתשלום, עם פלט מרבי של 32K (32,768) ו־40K (40,960) טוקנים בהתאמה. המחיר: 0.99 דולר למיליון טוקני קלט ו־1.49 דולר למיליון טוקני פלט. לשם השוואה, באותו קטלוג gpt-oss-120b מוצג עם 120 מיליארד פרמטרים, חלון הקשר 65k/131k וכ־3,000 טוקנים בשנייה.

מגבלות קצב ויכולות

במסלול החינמי המגבלות הן 5 בקשות בדקה, 30K טוקני קלט בדקה, 90K טוקנים בסך הכול בדקה, מיליון טוקנים ביום ועד 2 תמונות לבקשה. מסלול Developer מאפשר 300 בקשות בדקה, 150K טוקני קלט ו־450K טוקנים בסך הכול בדקה, עד 10 תמונות לבקשה, בלי תקרת טוקנים יומית מוצהרת. בין היכולות הנתמכות: קלט תמונות, הסקה, סטרימינג, בקרות דגימה, פלט מובנה, קריאה לכלים, קריאה מקבילה לכלים ושמירת פרומפט במטמון. זמינות שתי נקודות קצה: Chat Completions ו־Completions.

מגבלות שכדאי להכיר

ההסקה מופעלת כברירת מחדל ברמה "high" ואפשר לכבות אותה באמצעות reasoning_effort=none. קלט תמונות עובד רק דרך Chat Completions ובקידוד base64 של PNG או JPEG; כתובות URL חיצוניות לתמונות, בקרת רמת פירוט, יצירת תמונות, וידאו ואודיו אינם נתמכים. נקודת הקצה Completions מחזירה טקסט בלבד ואינה תומכת בתמונות, בבקרות הסקה, בהודעות צ'אט מובנות או בכלים.

מודלים לא־גזומים ודחיסה

התיעוד מבהיר שכל המודלים בנקודות הקצה הציבוריות הם הגרסאות המקוריות, שאינן גזומות. כימות המשקלים הוא סלקטיבי ומשמש רק לאחסון, ברמות 16, 8 ו־4 ביט; שכבות רגישות נשמרות בדיוק מלא והכימות מוסר תוך כדי ריצה, בעוד האקטיבציות, מנגנון הקשב ו־KV cache נשארים ללא כימות כלל. מודלים שנגזמו בשיטת REAP, שמחקרת החברה, מתפרסמים ב־Hugging Face אך אינם מוגשים דרך ה־API. Cerebras מצהירה שלא תשנה את הארכיטקטורה של מודל קיים בלי הודעה, וכל גיזום עתידי יוצע בנקודות קצה נפרדות בשמות מפורשים.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.