Назад
Qwen 3.8 27B на публічних ендпойнтах Cerebras: ~1 850 токенів за секунду
SiTech AI Team2 წთ. საკითხავი

Qwen 3.8 27B на публічних ендпойнтах Cerebras: ~1 850 токенів за секунду

Cerebras додала до каталогу 27B-мультимодальну модель Alibaba Qwen 3.8 27B: контекст 64K/128K, $0,99 за мільйон вхідних токенів і близько 1 850 токенів за секунду на публічних ендпойнтах.

Cerebras тепер указує Qwen 3.8 27B серед моделей, доступних на її публічних інференс-ендпойнтах. Модель Alibaba на 27 мільярдів параметрів стоїть поряд із gpt-oss-120b від OpenAI у каталозі моделей компанії, де для неї зазначено приблизно 1 850 токенів за секунду.

Що перелічено в каталозі

Ідентифікатор моделі — qwen-3.8-27b. Cerebras описує її як 27B-модель Alibaba типу dense, мультимодальну, призначену для агентного кодування, використання інструментів, досліджень і тривалих робочих процесів: вона приймає текст і зображення та підтримує налаштовуване міркування. Вікно контексту — 64K токенів (65 536) на безкоштовному тарифі та 128K токенів (131 072) на платних тарифах, максимальний вихід — 32K (32 768) і 40K (40 960) токенів відповідно. Ціни: $0,99 за мільйон вхідних токенів і $1,49 за мільйон вихідних. Для порівняння, у тому ж каталозі gpt-oss-120b має 120 мільярдів параметрів, контекст 65k/131k і близько 3 000 токенів за секунду.

Ліміти та можливості

На безкоштовному тарифі діють обмеження 5 запитів на хвилину, 30K вхідних токенів на хвилину, 90K токенів на хвилину загалом, 1M токенів на добу та до 2 зображень на запит. Тариф Developer дозволяє 300 запитів на хвилину, 150K вхідних токенів і 450K токенів загалом на хвилину, до 10 зображень на запит, без зазначеного добового ліміту. Підтримуються вхідні зображення, міркування, потокова передача, параметри вибірки, структуровані виходи, виклик інструментів, паралельний виклик інструментів і кешування підказок. Доступні два ендпойнти: Chat Completions і Completions.

Обмеження, які варто знати

Міркування типово ввімкнене на рівні "high"; вимкнути його можна, встановивши reasoning_effort у none. Вхідні зображення працюють лише через Chat Completions і мають бути PNG або JPEG у кодуванні base64; зовнішні URL зображень, керування деталізацією, генерація зображень, відео та аудіо не підтримуються. Ендпойнт Completions повертає лише текст і не підтримує зображення, керування міркуванням, структуровані повідомлення чи інструменти.

Незрізані моделі та стиснення

Документація наголошує, що на публічних ендпойнтах працюють оригінальні, незрізані версії моделей. Квантування ваг вибіркове й застосовується лише під час зберігання — у діапазоні 16, 8 і 4 біт; чутливі шари зберігаються з повною точністю, а деквантування виконується на льоту, тоді як активації, механізм уваги та KV-кеш залишаються повністю неквантованими. Моделі, зрізані методом REAP, який досліджує компанія, опубліковано на Hugging Face, але через API вони не надаються. Cerebras заявляє, що не змінюватиме архітектуру наявних моделей без попередження, а будь-яке майбутнє зрізання пропонуватиметься окремими, чітко названими ендпойнтами.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.