Geri Dön
Privatemode, GLM-5.3-Flash'ı Jev benzeri bir karar modeline dönüştürdü
SiTech AI Team2 წთ. საკითხავი

Privatemode, GLM-5.3-Flash'ı Jev benzeri bir karar modeline dönüştürdü

Alman gizli hesaplama sağlayıcısı Privatemode, hazır bir dil modelinin tek bir ileri geçişte her seçenek için olasılık içeren kararlar döndürebildiğini ve 29 veri kümesinde Jev'in doğruluğuna ulaştığını gösterdi.

Privatemode AI, hazır bir dil modelinin karar modeline nasıl dönüştürülebileceğini gösterdi. 24 Eylül'de yayımlanan blog yazısında Alman gizli hesaplama sağlayıcısı, GLM-5.3-Flash'ın her seçenek için bir olasılık taşıyan kararları tek bir ileri geçişte ve ince ayar olmadan döndürebildiğini bildirdi.

Bu iş için özel geliştirilen TypeSafe'in Jev'i ve Convai'nin Laya'sı gibi modeller, seçilen seçeneği her biri için bir güven değeriyle birlikte döndürür. Privatemode'un yöntemi aynı davranışı hazır bir LLM'den elde ediyor.

Yöntem nasıl çalışıyor

Bir dil modeli metni doğrudan yazmaz: her adımda tüm sözlüğü üzerinde bir olasılık dağılımı üretir. Yöntem tam da bunu kullanıyor. Durum, soru ve numaralanmış seçenekler isteme JSON olarak girer ve istem zaten choice_index: önekiyle bittiği için modelin bir sonraki token'ı bir seçenek numarası olmak zorundadır. Kitaplık o token'ı okumaz; modelin o konumda tüm seçenek numaralarına verdiği olasılıkları okur ve bunları seçenekler üzerinde normalleştirir.

Uygulama GLM-5.3-Flash'ı vLLM üzerinde çalıştırıyor ve /chat/completions uç noktasını continue_final_message ile add_generation_prompt: false parametreleriyle kullanıyor. vLLM'in allowed_token_ids'i sözlüğü yalnızca seçenek numaralarına daraltıyor, logprob_token_ids ise tam olarak istenen token'ların log olasılıklarını döndürüyor.

Jev ile aynı doğruluk

Yazarlar üç sistemi 2 ile 151 seçenek içeren 29 kamuya açık, etiketli veri kümesi üzerinde test etti; metinler İngilizce ve Almanca. 28 metin kümesinde GLM-5.3-Flash ve Jev başa baş: her biri 10 kümede daha doğru, sekizinde fark bir yüzde puanının altında ve Jev lehine 0,7 puanlık medyan fark istatistiksel olarak anlamsız (p = 0,64). Yerel çalıştırılan 421 milyon parametreli Laya ise ikisinin 13-15 puan gerisinde.

Gecikme, maliyet ve görseller

Yanıt süresi konuma bağlı: tek istek ölçümünde Privatemode Almanya'dan 180 ms'de, Jev ise 264 ms'de yanıt verdi; ABD'den sıralama tersine dönüyor, Jev 164 ms ve Privatemode 299 ms. Maliyette Jev daha ucuz: bir milyon karar GLM-5.3-Flash ile yaklaşık 62 avro, Jev ile yaklaşık 16 avro. Jev soru başına yaklaşık 270 sabit token ve seçenek başına 10 token ekliyor, GLM-5.3-Flash istemi ise yaklaşık 55 ve 20.

GLM-5.3-Flash görsellerle çalışabildiği için bir soru görüntü içerebilir; Jev ve Laya yalnızca metinle çalışıyor. 16 sınıfta 1.600 taranmış iş belgesinden oluşan RVL-CDIP'te model %70,2 doğruluğa ulaşıyor ve görsel yaklaşık 1.350 giriş token'ı ekliyor. Yazarlar bir sınırlamayı da not ediyor: akıl yürütmeyi açmak daha doğru sonuç veriyor ama milyon karar başına yaklaşık 350 avroya mal oluyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.