Geri Dön
PrismML, 9 kat daha küçük Bonsai 2 27B'yi yayımladı
SiTech AI Team2 წთ. საკითხავი

PrismML, 9 kat daha küçük Bonsai 2 27B'yi yayımladı

PrismML, Qwen3.8 27B tabanlı 5,9 GB boyutundaki Ternary Bonsai 2 27B'yi yayımladı. Model, tam hassasiyetli sürümden dokuz kat küçük olmasına karşın test puanlarının %98,2'sini koruyor.

Kaliforniya Teknoloji Enstitüsü'nden araştırmacıların kurduğu PrismML, 17 Eylül'de Ternary Bonsai 2 27B'yi yayımladı: Qwen3.8 27B tabanlı, türediği tam hassasiyetli sürümden çok daha az belleğe ihtiyaç duyan çok modlu bir model. Şirkete göre bu, yerel cihazlarda çalışacak modeller serisindeki en büyük adım; ilk Bonsai 27B sürümü iki ay önce gelmişti.

Model, FP16 grup bazlı ölçeklemeyle birlikte üç değerli ağırlıklar kullanıyor — eksi bir, sıfır veya artı bir — ve ağırlık başına 1,76 etkin bit elde ediyor. Toplam boyut 5,9 GB, bağlam penceresi 262 bin tokene ulaşıyor ve model hem metin hem görüntü girdisini işliyor. Apache 2.0 lisansıyla dağıtılıyor, ağırlıklar şimdiden erişilebilir durumda.

Test sonuçları

Akıl yürütme, matematik, kodlama, talimat izleme, görme ve ajan tabanlı araç kullanımını kapsayan test setinde Ternary Bonsai 2 27B 83,9 puan alıyor ve Qwen3.8 27B'nin toplam performansının %98,2'sini koruyor. Karşılaştırma için tam hassasiyetli Qwen3.8 27B 85,4, önceki Qwen3.6 27B ise 83,6 puan alıyor.

Kategoriler bazında sıkıştırılmış model özellikle talimat izlemede öne geçiyor: 82,66'ya karşı tam hassasiyetli sürümde 81,25 ve Qwen3.6 27B'de 74,53. Matematik 96,57 (tam hassasiyette 97,06), kodlama 81,58 (82,17), ajan görevleri ve araç çağırma 77,57 (79,74), bilgi ve akıl yürütme 83,95 (86,66), görme ise 78,59 (81,64).

Sıkıştırma neden önemli

PrismML'ye göre önceki Bonsai 27B sürümü tam hassasiyetli modelin performansının %95'ini koruyordu; yeni sürüm bu oranı %98'in üzerine taşıyor ve şirket bunu pratikte kayıpsız olarak tanımlıyor. Kod ajanları, araç tabanlı sistemler, çok modlu iş akışları ve uzun soluklu görevler model bozulmasına karşı özellikle hassas, çünkü küçük hatalar çok sayıda adımda birikir. Şirket, Bonsai 2 27B'nin tam da bu alanlarda yeteneğin büyük bölümünü çok daha az bellekle koruduğunu savunuyor.

Hız tarafında model bir NVIDIA GeForce RTX 5090 üzerinde saniyede 143 tokene, M5 Max üzerinde ise 46,8 tokene ulaşıyor. RTX 4090'da token başına 0,714 mWh tüketiyor; PrismML'ye göre bu, tam hassasiyette çalışan 8B'lik bir modelden %40 daha verimli. Model NVIDIA GPU'larında CUDA, Apple cihazlarında (Mac, iPhone, iPad) ise MLX üzerinden, özel düşük bit çekirdekleriyle çalışıyor.

Arka plan

Önceki nesil Bonsai 27B Temmuz 2026'da gelmişti: dizüstü bilgisayarlar için 5,9 GB'lık üç değerli sürüm ve iPhone 17 Pro için 3,9 GB'lık 1 bit sürüm, her ikisi de 262 bin tokenlık bağlamla. PrismML, Khosla Ventures, Cerberus ve Google desteğiyle kurulduğunu, Samsung'un desteğinin sürdüğünü belirtiyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.