
Stanford və NVIDIA-dan CLM-8B: qərarlar üçün sürətli System One modeli
Stanford və NVIDIA Research komandası vəziyyətləri hərəkətlərlə ortaq məkanda birləşdirən Contrastive Language Models modelini təqdim edib. CLM-8B kompüter istifadəsi, oyun və alət çağırma tapşırıqlarında Jev səviyyəsində işləyir, lakin 9 dəfə sürətlidir.
Contrastive Language Model nədir
Stanford University və NVIDIA Research komandası Jacky Kwok-un rəhbərliyi ilə sentyabrın 23-də Contrastive Language Models (CLM) modelini təqdim edib. Müəlliflər CLM-i yeni System One model sinfi adlandırır: addım-addım düşünmək əvəzinə o, vəziyyət kodlaşdırıcısını hərəkət kodlaşdırıcısı ilə ortaq embedding məkanında birləşdirərək sürətli, refleksiv qərarlar qəbul edir; təlim ikiistiqamətli InfoNCE kontrast funksiyası ilə aparılır.
İstifadə zamanı iki kodlaşdırıcı sıfır təlimli (zero-shot) hərəkət təsnifatçısı kimi çıxış edir: cari vəziyyət və namizəd hərəkətlər verildikdə CLM hər namizədi vəziyyət embeddingi ilə kosinus oxşarlığına görə qiymətləndirir və ən yüksəyini seçir. Hər kodlaşdırıcı donmuş LLM bazası ilə 20 milyon parametrli öyrədilə bilən proyeksiya başlığını birləşdirir; qradiyent yalnız başlığa gedir. Nemotron DQA üzərində tam ilkin təlim bir RTX 4090-da təxminən bir saat çəkir.
Üç mərhələli məlumat resepti
İlkin təlim Nemotron DQA-dan təxminən 60 milyon sual-cavab cütünü əhatə edir: sual vəziyyət, cavab isə hərəkət sayılır. Aralıq mərhələdə Gemini 2.5 Flash-Lite ilə hazırlanmış təxminən 30 milyon sintetik çətin neqativ əlavə olunur, son təlimdə isə Agent Data Protocol-dən təxminən 1 milyon agent trayektoriyası istifadə edilir.
Nəticələr və gecikmə
Kompüter istifadəsi, oyun və alət çağırma tapşırıqlarında CLM-8B Jev ilə eyni səviyyədə çalışır, lakin 9 dəfəyə qədər sürətlidir; təxminən 1000 namizəd hərəkətdə fərq 13 dəfəyə çatır. Trayektoriya verifikatoru kimi incə tənzimlənən model DeepSWE (81,6%) və Terminal-Bench 2.1 (87,6%) testlərində yeni rekord qoyur, H100 GPU-da inferens isə Jev-dən 4-6 dəfə sürətlidir və yoxlama 38 və 30 ayrılmış tapşırıqda aparılıb.
İnfrastruktur və növbəti addımlar
Servis infrastrukturu vəziyyətləri və hərəkətləri ayırır ki, onların embeddingləri ayrı-ayrı keşlənə bilsin: yalnız vəziyyətin dəyişdiyi Super Mario kimi hallarda hər addım beş yerinə bir keçid tələb edir. Komanda həmçinin CLM üçün miqyaslama qanunlarını müəyyən edib: test kontrast itkisi hesablama, məlumat və model ölçüsü artdıqca güc qanunu ilə azalır. Multimodal CLM-35B artıq təlimdədir və gələn ayın əvvəlində buraxılması planlaşdırılır.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.