
Stanford і NVIDIA представили CLM-8B, швидку модель System One для рішень
Команда Stanford University та NVIDIA Research представила Contrastive Language Models: модель зіставляє стани та дії у спільному просторі. CLM-8B не поступається Jev у роботі з комп'ютером, іграх і викликах інструментів, працюючи до 9 разів швидше.
Що таке Contrastive Language Model
Команда Stanford University і NVIDIA Research під керівництвом Джекі Квока представила 23 вересня Contrastive Language Models (CLM). Автори описують CLM як новий клас моделей System One: замість покрокових міркувань вона ухвалює швидкі, рефлекторні рішення, зіставляючи енкодер станів з енкодером дій у спільному просторі ембедингів, а навчання ведеться двонапрямною контрастивною функцією InfoNCE.
У роботі два енкодери діють як zero-shot класифікатор дій: для поточного стану й набору кандидатів CLM оцінює кожен варіант за косинусною схожістю з ембедингом стану і вибирає найвищий. Кожен енкодер поєднує заморожений бекбон LLM із навчальною проєкційною головою на 20 млн параметрів, тож градієнти отримує лише вона; повне попереднє навчання на корпусі Nemotron DQA триває близько години на одній RTX 4090.
Триетапний рецепт даних
Попереднє навчання охоплює близько 60 млн пар питань і відповідей з Nemotron DQA, де питання є станом, а відповідь дією. На проміжному етапі додають приблизно 30 млн синтетичних складних негативів, створених за допомогою Gemini 2.5 Flash-Lite, а на пост-навчанні використовують близько 1 млн агентних траєкторій з Agent Data Protocol.
Результати та швидкість
У завданнях роботи з комп’ютером, іграх і виклику інструментів CLM-8B не поступається Jev, працюючи до 9 разів швидше, а за приблизно 1000 кандидатів-дій розрив сягає 13 разів. Доопрацьована як верифікатор траєкторій, модель встановлює новий рекорд на DeepSWE (81,6%) і Terminal-Bench 2.1 (87,6%), а інференс на H100 GPU у 4-6 разів швидший за Jev на 38 і 30 відкладених завданнях.
Інфраструктура та подальші кроки
Сервінг розділяє стани й дії, щоб їхні ембединги кешувалися незалежно: коли змінюється лише стан, як у Super Mario, кожен крок потребує одного проходу замість п’яти. Команда також вивела закони масштабування: тестова контрастивна втрата спадає за степеневим законом залежно від обчислень, даних і розміру моделі. Мультимодальна CLM-35B вже навчається, реліз заплановано на початок наступного місяця.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.