Назад
SiTech Team⏱️ 6 წთ. საკითხავი

NVIDIA Vera Rubin — інтелект за долар: нова ера пост-тренування AI в епоху агентного штучного інтелекту

NVIDIA Vera Rubin — інтелект за долар: нова ера пост-тренування AI в епоху агентного штучного інтелекту

Платформа NVIDIA Vera Rubin потребує в 4 рази менше GPU для пост-тренувальних навантажень порівняно з Blackwell — це новий еталон метрики «інтелект за долар» (intelligence per dollar).

Зсув до агентного AI: чому пост-тренування стає безперервним

Уявіть професійного спортсмена. Елітних виконавців відрізняє те, що відбувається між іграми: постійне вдосконалення, адаптація до нових суперників, відточення навичок на основі помилок минулого матчу. Агентний AI працює так само. Модель більше не просто відповідає на запит — вона отримує ціль і повинна постійно адаптуватися, оскільки середовище змінюється, з'являються нові граничні випадки, а інструменти оновлюються щотижня.

Це фундаментально змінює те, як ми думаємо про підготовку AI-моделей. Пост-тренування (post-training) — фаза, яка вдосконалює модель після початкового навчання на сирих даних — більше не є одноразовим завершальним кроком. Воно стає безперервним, тому що середовище, в якому працюють агентні моделі, постійно еволюціонує. Інструменти, які використовує агент, можуть змінюватися щотижня. У продакшені з'являються граничні випадки, які не передбачив жоден тестовий набір. Кожне розгортання приносить власну кодову базу, політики та середовище.

Споживання обчислювальних ресурсів зростає не тому, що якийсь один запуск став більшим, а тому, що запуски ніколи не зупиняються. Саме це робить пост-тренування центральним навантаженням агентної епохи — і головним рушієм інтелекту за долар.

Що таке пост-тренування і чому це важливо

Пост-тренування — це те місце, де створюється інтелект. Під час попереднього тренування (pre-training) модель вчиться передбачати наступний токен — це дає їй плавність володіння мовою, але не інтелект. Пост-тренування — це коли модель вчиться писати код, планувати багатокрокові завдання, використовувати пошуковий інструмент і відновлюватися після помилок.

Інференс (inference) — це те, що відбувається далі: модель працює на завданні, оцінена у вартості за токен (cost per token). Але пост-тренування працює інакше. Оскільки немає готової відповіді для запам'ятовування — лише винагорода — модель навчається через техніки навчання з підкріпленням (RL).

Ось як працює процес: отримавши завдання, модель робить спробу — прямий прохід (forward pass) (та сама робота, яку вона виконувала б у продакшені). Спробу оцінюють, і отриманий урок оновлює ваги моделі — зворотний прохід (backward pass). Через мільйони спроб інтелект зростає. Кожен крок є обчислювально інтенсивним, і масштабування цього циклу є проблемою оркестрації: тисячі середовищ, що паралельно генерують rollouts, верифікація винагород і оновлені ваги, які повертаються в тренування.

Відкриті бібліотеки NVIDIA NeMo — такі як NeMo Gym для тренувальних середовищ і NeMo RL для розподіленого пост-тренування — перетворюють пост-тренування з індивідуального дослідницького коду на повторювану, продакшн-готову інфраструктуру.

Інтелект за долар: розширення cost per token

Якщо інференс — це двигун доходу, то пост-тренування — це мультиплікатор: чим здібніша модель, тим вища цінність кожного обслуженого токена. Cost per token — ключова метрика для фабрики інференсу — повна вартість доставки одного мільйона токенів.

Інтелект за долар (intelligence per dollar) знаходиться на один рівень вище, відповідаючи на інше питання: скільки коштує побудувати модель, яку варто обслуговувати — і підтримувати її цінність у мінливому середовищі? Ці дві метрики вкладені одна в одну, а не конкурують. AI-інфраструктура, яка знижує cost per token, також знижує вартість кожної точки інтелекту, вбудованої в модель. І кожна точка інтелекту підвищує цінність кожного токена, який обслуговує фабрика інференсу.

Іншими словами: cost per token вимірює операційну ефективність; intelligence per dollar вимірює, чи окупаються інвестиції в інтелект моделі. Оскільки кожен прямий прохід у пост-тренуванні — це, по суті, робота інференсу, що вимірюється в cost per token, кожне покращення ефективності інференсу безпосередньо впливає на рівняння інтелекту за долар.

Vera Rubin: вчетверо менше GPU, максимум інтелекту

Платформа NVIDIA Blackwell вже знизила вартість запуску, зробивши часте пост-тренування, якого вимагає агентна епоха, економічно життєздатним. Але Vera Rubin значно розширює цю траєкторію — вона тренує найбільші моделі, використовуючи вчетверо менше GPU порівняно з поколінням Blackwell.

Vera Rubin була спроєктована від початку до кінця, щоб максимізувати інтелект за долар для агентного пост-тренувального навантаження: більше rollouts за запуск, більше одночасних середовищ і цикли пост-тренування, які ніколи не зупиняються. Цей приріст ефективності означає, що організації можуть досягти того ж рівня інтелекту — або більшого — зі значно меншими інвестиціями в обладнання.

Це важливо, тому що cost per token та intelligence per dollar тісно пов'язані. Кожне зниження вартості прямого проходу (інференсу) безпосередньо зменшує вартість кожного циклу навчання в пост-тренуванні, накопичуючи економію на мільйонах спроб.

Nemotron 3 Ultra: відкритий інтелект, результати, що піддаються верифікації

Nemotron 3 Ultra від NVIDIA — це модель із відкритими вагами (open-weight) на 550 мільярдів параметрів, побудована за архітектурою суміші експертів (MoE). Вона пропонує верифіковані бенчмарки та повністю опублікований рецепт пост-тренування, запущений на NeMo RL. Модель отримала 71,7% на SWE-bench verified — реальному бенчмарку кодування, де вона змогла виправити приблизно сім із десяти реальних програмних помилок із проєктів з відкритим кодом, кожна перевірена власними тестами проєкту.

Для пост-тренування Nemotron 3 Ultra було використано приблизно 20 мільярдів токенів rollout, масштабовано з приблизно 1,2 мільйона rollout попереднього покоління Nemotron 3 Super, кожен приблизно по 10 000 токенів. Важливо, що співвідношення інтелекту за долар між платформами не залежить від цього конкретного припущення — абсолютні значення масштабуються з кількістю токенів, але відносна перевага Vera Rubin над Blackwell залишається сталою.

Повна екосистема: NeMo, Dynamo та впровадження в індустрії

Платформа Vera Rubin є частиною ширшої, інтегрованої екосистеми NVIDIA для агентного AI:

  • NeMo Gym та NeMo RL — Бібліотеки з відкритим кодом, які перетворюють пост-тренування з індивідуального дослідницького коду на повторювану інфраструктуру. NeMo Gym керує тренувальними середовищами; NeMo RL забезпечує розподілене пост-тренування в масштабі.
  • NVIDIA Dynamo — Оркестрація інференсу для максимізації пропускної здатності та мінімізації затримки в продакшені.

Лідери індустрії вже використовують цю екосистему:

  • Prime Intellect — безперервно виконує пост-тренування передових відкритих моделей на NVIDIA Blackwell і планує масштабувати RL-середовища на Vera Rubin. Їхнє бенчмаркування показує на 30% вищу пропускну здатність на CPU з NVIDIA Vera CPU порівняно з альтернативними архітектурами x86.
  • Perplexity — запускає свій стек RL пост-тренування асинхронно на сотнях NVIDIA GPU, з рушієм передачі ваг на основі RDMA, який синхронізує моделі з трильйоном параметрів менш ніж за дві секунди між тренувальними та інференс-вузлами.
  • Together AI — пропонує пост-тренування як послугу, включаючи контрольоване доналаштування, RL та оптимізацію прямих переваг на платформі NVIDIA, з планами використовувати Vera Rubin наступними.

Майбутнє безперервного інтелекту

З появою Vera Rubin, NVIDIA переосмислює, як ми вимірюємо ефективність AI-інвестицій. Інтелект за долар стає визначальною метрикою того, яка платформа найкраще служить епосі агентного AI — де моделі не просто відповідають на запити, а планують, міркують, використовують інструменти, відновлюються після невдач і постійно вдосконалюються.

Оскільки AI-моделі переходять від простого Q&A до складної, багатокрокової поведінки, що постійно адаптується, роль пост-тренування лише зростатиме. Платформа NVIDIA Vera Rubin — у поєднанні з бібліотеками NeMo, моделлю Nemotron 3 Ultra та оркестратором інференсу Dynamo — створює інтегровану, наскрізну систему, яка максимізує інтелектуальну віддачу від кожного інвестованого долара.

Це нова ера AI-інфраструктури. Питання більше не в тому, «скільки в мене GPU?», а «скільки інтелекту я отримую за кожен долар?»

📖 Джерело