
Qwen 3.8 27B Cerebras-ის საჯარო ენდპოინტებზე — წამში ~1850 ტოკენი
Cerebras-ის მოდელების კატალოგში დაემატა Alibaba-ს 27-მილიარდიანი მულტიმოდალური მოდელი Qwen 3.8 27B: 64K/128K კონტექსტი, 0,99 დოლარი მილიონ შემავალ ტოკენზე და ~1850 ტოკენი წამში საჯარო ენდპოინტებზე.
Cerebras-ის ინფერენს დოკუმენტაციის „მოდელების კატალოგი" ახლა საჯარო ენდპოინტებზე Qwen 3.8 27B-ს ჩამოთვლის — Alibaba-ს 27-მილიარდიანი მოდელი, რომელიც gpt-oss-120b-ის გვერდით მუშაობს და კატალოგის მიხედვით წამში დაახლოებით 1850 ტოკენის სიჩქარეს აღწევს.
რას ჩამოთვლის კატალოგი
მოდელის ID არის qwen-3.8-27b. აღწერაში ნათქვამია, რომ ეს არის Alibaba-ს 27-მილიარდიანი მკვრივი (dense) მულტიმოდალური მოდელი აგენტური კოდირებისთვის, ხელსაწყოების გამოყენებისთვის, კვლევისთვის და ხანგრძლივი სამუშაო პროცესებისთვის. ის იღებს ტექსტსა და სურათებს და მხარს უჭერს რეგულირებად მსჯელობას (reasoning). კონტექსტის ფანჯარა: 64 ათასი ტოკენი (65 536) უფასო საცდელ რეჟიმში და 128 ათასი (131 072) ფასიან პაკეტებში; მაქსიმალური გამოტანა — 32 ათასი (32 768) და 40 ათასი (40 960) ტოკენი. ფასი: 0,99 დოლარი მილიონ შემავალ ტოკენზე და 1,49 დოლარი მილიონ გამომავალ ტოკენზე. შედარებისთვის, იმავე კატალოგში gpt-oss-120b მითითებულია 120 მილიარდი პარამეტრით, 65k/131k კონტექსტით და წამში დაახლოებით 3000 ტოკენით.
ლიმიტები და შესაძლებლობები
უფასო საცდელ პაკეტში ლიმიტია წუთში 5 მოთხოვნა, 30 ათასი შემავალი ტოკენი წუთში, 90 ათასი ტოკენი წუთში ჯამში და 1 მილიონი ტოკენი დღეში, თითო მოთხოვნაზე 2 სურათამდე. Developer დონეზე — წუთში 300 მოთხოვნა, 150 ათასი შემავალი ტოკენი და 450 ათასი ტოკენი წუთში ჯამში, 10 სურათამდე მოთხოვნაზე და დღიური ლიმიტის გარეშე. მხარდაჭერილი ფუნქციებია: სურათების შემავალი მონაცემები, მსჯელობა, სტრიმინგი, შერჩევის პარამეტრები, სტრუქტურირებული გამოტანა, ხელსაწყოების გამოძახება, პარალელური გამოძახება და პრომპტის ქეშირება. ხელმისაწვდომია ორი ენდპოინტი — Chat Completions და Completions.
შეზღუდვები, რომლებიც უნდა იცოდეთ
მსჯელობა ნაგულისხმევად ჩართულია „high" დონეზე; მისი გამორთვა reasoning_effort=none პარამეტრით შეიძლება. სურათების შეყვანა მუშაობს მხოლოდ Chat Completions-ის გავლით და მხოლოდ base64-ით კოდირებული PNG ან JPEG მონაცემების სახით; გარე სურათის ბმულები, დეტალების კონტროლი, სურათების გენერაცია, ვიდეო და აუდიო არ მუშაობს. Completions ენდპოინტი მხოლოდ ტექსტს აბრუნებს და არ უჭერს მხარს სურათებს, მსჯელობის კონტროლს, სტრუქტურირებულ შეტყობინებებსა და ხელსაწყოებს.
დაუჭრელი მოდელები და შეკუმშვა
დოკუმენტაცია ცალკე განმარტავს, რომ საჯარო ენდპოინტებზე მხოლოდ ორიგინალური, დაუჭრელი მოდელები მუშაობს. Cerebras შენახვისას იყენებს მხოლოდ წონების შერჩევით კვანტიზაციას 16/8/4 ბიტამდე, ხოლო მგრძნობიარე ფენები სრული სიზუსტით ინახება და დეკვანტიზაცია „ფრენის დროს" ხდება; აქტივაციები, ყურადღების მექანიზმი და KV ქეში სრულად დაუკვანტიზებელი რჩება. REAP-ით (Router-weighted Expert Activation Pruning) დაჭრილი კვლევითი მოდელები Hugging Face-ზეა გამოქვეყნებული, მაგრამ API-დან არ მიეწოდება. კომპანია აცხადებს, რომ არსებული ენდპოინტების არქიტექტურას შეტყობინების გარეშე არ შეცვლის და მომავალი დაჭრა ცალკე ენდპოინტებად შეთავაზდება.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.