Վերադառնալ
SiTech Team⏱️ 6 წთ. საკითხავი

NVIDIA Vera Rubin — ինտելեկտը մեկ դոլարի դիմաց. AI հետվերապատրաստման նոր դարաշրջանը ագենտային AI-ի ժամանակաշրջանում

NVIDIA Vera Rubin — ինտելեկտը մեկ դոլարի դիմաց. AI հետվերապատրաստման նոր դարաշրջանը ագենտային AI-ի ժամանակաշրջանում

NVIDIA-ի Vera Rubin հարթակը հետվերապատրաստման (post-training) աշխատանքային ծանրաբեռնվածությունների համար պահանջում է 4 անգամ ավելի քիչ GPU, քան Blackwell-ը. սա ինտելեկտը մեկ դոլարի դիմաց (intelligence per dollar) չափման նոր հենանիշ է:

Անցումը դեպի ագենտային AI. ինչու է հետվերապատրաստումը դառնում շարունակական

Պատկերացրեք պրոֆեսիոնալ մարզիկի: Էլիտար կատարողներին միմյանցից տարբերում է այն, ինչ տեղի է ունենում խաղերի միջև՝ շարունակական կատարելագործում, նոր մրցակիցներին հարմարվել, վերջին խաղի բացահայտած սխալների վրա հմտությունների սրում: Ագենտային AI-ն աշխատում է հենց այդպես: Մոդելն այլևս պարզապես պատասխանում է հարցմանը — նրան տրվում է նպատակ, և նա պետք է շարունակի հարմարվել, քանի որ միջավայրը փոխվում է, եզրային դեպքեր են ի հայտ գալիս, և գործիքները փոխվում են շաբաթից շաբաթ:

Սա արմատապես փոխում է այն, թե ինչպես ենք մտածում AI մոդելների պատրաստման մասին: Հետվերապատրաստումը (post-training) — այն փուլը, որը կատարելագործում է մոդելը հում տվյալներով նախնական ուսուցումից հետո — այլևս միանգամյա ավարտական քայլ չէ: Այն շարունակական է, որովհետև միջավայրը, որտեղ գործում են ագենտային մոդելները, անընդհատ զարգանում է: Գործիքները, որոնք օգտագործում է ագենտը, կարող են փոխվել շաբաթից շաբաթ: Արտադրությունում ի հայտ են գալիս եզրային դեպքեր, որոնք ոչ մի թեստային հավաքածու չի կանխատեսել: Յուրաքանչյուր տեղակայում բերում է իր կոդի բազան, քաղաքականությունները և միջավայրը:

Հաշվողական ռեսուրսների սպառումն աճում է ոչ թե այն պատճառով, որ որևէ մեկ գործարկում ավելի մեծ է, այլ որովհետև գործարկումները երբեք չեն դադարում: Սա հենց հետվերապատրաստումը դարձնում է ագենտային դարաշրջանի կենտրոնական աշխատանքային ծանրաբեռնվածությունը — և ինտելեկտը մեկ դոլարի դիմաց հիմնական շարժիչը:

Ինչ է հետվերապատրաստումը և ինչու է այն կարևոր

Հետվերապատրաստումն այն վայրն է, որտեղ ինտելեկտը կառուցվում է: Նախնական ուսուցման (pre-training) ժամանակ մոդելը սովորում է կանխատեսել հաջորդ տոկենը — սա նրան տալիս է լեզվի սահունություն, բայց ոչ ինտելեկտ: Հետվերապատրաստումն այն է, երբ մոդելը սովորում է կոդ գրել, բազմաքայլ առաջադրանք պլանորոշել, որոնողական գործիք օգտագործել և վերականգնվել, երբ ինչ-որ բան սխալ է գնում:

Ինֆերենսը (inference) այն է, ինչ գալիս է հետո. մոդելն աշխատում է առաջադրանքի վրա՝ գնահատված տոկենի արժեքով (cost per token): Բայց հետվերապատրաստումն աշխատում է այլ կերպ: Քանի որ չկա անգիր սովորելու ճիշտ պատասխան — միայն պարգև — մոդելը սովորում է ամրապնդող ուսուցման (RL) տեխնիկաներով:

Ահա թե ինչպես է ընթանում գործընթացը. ստանալով առաջադրանք, մոդելը կատարում է փորձ — ուղիղ անցում (forward pass) (նույն աշխատանքը, որը կկատարեր արտադրությունում): Փորձը գնահատվում է, և դասը թարմացնում է մոդելի կշիռները — հակադարձ անցում (backward pass): Միլիոնավոր փորձերի ընթացքում ինտելեկտն աճում է: Յուրաքանչյուր քայլ հաշվողականորեն ինտենսիվ է, և այս ցիկլը մասշտաբավորելը օրկեստրացիայի խնդիր է. հազարավոր միջավայրեր, որոնք զուգահեռաբար ստեղծում են rollouts, պարգևների ստուգում և թարմացված կշիռներ, որոնք հետ են հոսում ուսուցում:

NVIDIA-ի NeMo բաց գրադարանները — ինչպիսիք են NeMo Gym-ը ուսումնական միջավայրերի համար և NeMo RL-ը բաշխված հետվերապատրաստման համար — հետվերապատրաստումը վերածում են պատվերով հետազոտական կոդից կրկնելի, արտադրական մակարդակի ենթակառուցվածքի:

Ինտելեկտը մեկ դոլարի դիմաց. cost per token-ի ընդլայնում

Եթե ինֆերենսը եկամտի շարժիչն է, հետվերապատրաստումը բազմապատկիչն է. որքան ունակ է մոդելը, այնքան բարձր է յուրաքանչյուր սպասարկված տոկենի արժեքը: Cost per token-ը ինֆերենսի գործարանի հիմնական չափանիշն է — մեկ միլիոն տոկենի մատակարարման ամբողջական արժեքը:

Ինտելեկտը մեկ դոլարի դիմաց (intelligence per dollar) մեկ մակարդակ վերևում է և պատասխանում է այլ հարցի. ինչ արժե կառուցել մոդել, որն արժե սպասարկել — և պահպանել դրա արժեքը, երբ միջավայրը փոխվում է: Այս երկու չափանիշները բույնված են միմյանց մեջ, ոչ թե մրցակից: AI ենթակառուցվածքը, որը նվազեցնում է cost per token-ը, նաև նվազեցնում է մոդելում ներկառուցված ինտելեկտի յուրաքանչյուր կետի արժեքը: Եվ ներկառուցված ինտելեկտի յուրաքանչյուր կետը բարձրացնում է յուրաքանչյուր տոկենի արժեքը, որը սպասարկում է ինֆերենսի գործարանը:

Այլ կերպ ասած. cost per token-ը չափում է գործառնական արդյունքը; intelligence per dollar-ը չափում է, թե արդյոք մոդելի ինտելեկտի մեջ ներդրումն արդարացնում է իրեն: Քանի որ հետվերապատրաստման յուրաքանչյուր ուղիղ անցումը էապես ինֆերենսի աշխատանք է, որը չափվում է cost per token-ով, ինֆերենսի արդյունավետության յուրաքանչյուր բարելավում ուղղակիորեն հոսում է ինտելեկտը մեկ դոլարի դիմաց հավասարման մեջ:

Vera Rubin. չորս անգամ ավելի քիչ GPU, առավելագույն ինտելեկտ

NVIDIA-ի Blackwell հարթակն արդեն իջեցրել էր գործարկման արժեքը՝ ագենտային դարաշրջանի պահանջած հաճախակի հետվերապատրաստումը տնտեսապես կենսունակ դարձնելով: Սակայն Vera Rubin այս հետագիծը կտրուկ ընդլայնում է. այն վերապատրաստում է ամենամեծ մոդելները չորս անգամ ավելի քիչ GPU-ներով, քան Blackwell-ի սերունդը:

Vera Rubin-ը սկզբից մինչև վերջ նախագծվել է առավելագույնի հասցնել ինտելեկտը մեկ դոլարի դիմաց ագենտային հետվերապատրաստման բեռի համար. ավելի շատ rollouts յուրաքանչյուր գործարկման մեջ, ավելի շատ միջավայրեր միաժամանակ և հետվերապատրաստման ցիկլեր, որոնք երբեք չեն դադարում: Արդյունավետության այս աճը նշանակում է, որ կազմակերպությունները կարող են հասնել նույն ինտելեկտին — կամ ավելիին — զգալիորեն ավելի քիչ ապարատային ներդրումներով:

Սա կարևոր է, քանի որ cost per token-ը և intelligence per dollar-ը սերտորեն կապված են: Ուղիղ անցման (ինֆերենս) արժեքի յուրաքանչյուր նվազում ուղղակիորեն նվազեցնում է հետվերապատրաստման յուրաքանչյուր ուսումնական ցիկլի արժեքը՝ միլիոնավոր փորձերի ընթացքում կուտակային խնայողություններ ապահովելով:

Nemotron 3 Ultra. բաց կշիռներով ինտելեկտ, ստուգելի արդյունքներ

NVIDIA-ի Nemotron 3 Ultra — բաց կշիռներով (open-weight), 550 միլիարդ պարամետրանոց փորձագետների խառնուրդի (MoE) մոդել — առաջարկում է ստուգելի չափանիշներ և ամբողջությամբ հրապարակված հետվերապատրաստման բաղադրատոմս, որը գործարկվել է NeMo RL-ի վրա: Այն ստացել է 71.7% SWE-bench verified-ում՝ իրական աշխարհի ծրագրավորման չափանիշ, որտեղ այն աշխատող ուղղում է արտադրել բաց կոդով նախագծերի մոտավորապես տասը իրական ծրագրային սխալներից յոթի համար, որոնցից յուրաքանչյուրը ստուգված է նախագծի սեփական թեստերով:

Nemotron 3 Ultra-ի հետվերապատրաստման գործարկումը օգտագործել է մոտավորապես 20 միլիարդ rollout տոկեն՝ մասշտաբավորված նախորդ սերնդի Nemotron 3 Super-ի ~1,2 միլիոն rollouts-ից՝ յուրաքանչյուրը մոտ 10,000 տոկենով: Կարևոր է, որ հարթակների միջև ինտելեկտը մեկ դոլարի դիմաց հարաբերակցությունը անկախ է այս կոնկրետ ենթադրությունից — բացարձակ արժեքները մասշտաբավորվում են տոկենների քանակի հետ, բայց Vera Rubin-ի հարաբերական առավելությունը Blackwell-ի նկատմամբ մնում է հաստատուն:

Ամբողջական էկոհամակարգը. NeMo, Dynamo և արդյունաբերական ընդունում

Vera Rubin հարթակը ագենտային AI-ի համար NVIDIA-ի ավելի լայն, ինտեգրված էկոհամակարգի մասն է:

  • NeMo Gym և NeMo RL — Բաց կոդով գրադարաններ, որոնք հետվերապատրաստումը պատվերով հետազոտական կոդից վերածում են կրկնելի ենթակառուցվածքի: NeMo Gym-ը ղեկավարում է ուսումնական միջավայրերը; NeMo RL-ը ղեկավարում է բաշխված հետվերապատրաստումը մասշտաբում:
  • NVIDIA Dynamo — Ինֆերենսի օրկեստրացիա՝ արտադրությունում թողունակությունը առավելագույնի հասցնելու և ուշացումը նվազագույնի հասցնելու համար:

Արդյունաբերության առաջատարներն արդեն օգտագործում են այս էկոհամակարգը.

  • Prime Intellect — շարունակաբար հետվերապատրաստում է առաջատար բաց մոդելները NVIDIA Blackwell-ի վրա և նախատեսում է մասշտաբավորել RL միջավայրերը Vera Rubin-ում: Նրանց համեմատական չափումները ցույց են տալիս 30%-ով ավելի մեծ թողունակություն մեկ CPU-ի համար NVIDIA Vera CPU-ներով՝ համեմատած այլընտրանքային x86 ճարտարապետությունների հետ:
  • Perplexity — իր RL հետվերապատրաստման ստեկը գործարկում է ասինխրոն կերպով հարյուրավոր NVIDIA GPU-ների վրա՝ RDMA-ի վրա հիմնված կշիռների փոխանցման շարժիչով, որը տրիլիոն պարամետրանոց մոդելները սինխրոնիզացնում է երկու վայրկյանից էլ քիչ ժամանակում ուսուցման և ինֆերենսի հանգույցների միջև:
  • Together AI — առաջարկում է հետվերապատրաստումը որպես ծառայություն, ներառյալ վերահսկվող ճշգրտումը, RL-ը և ուղղակի նախապատվության օպտիմիզացումը NVIDIA-ի հարթակում, ծրագրերով հաջորդիվ օգտագործել Vera Rubin-ը:

Շարունակական ինտելեկտի ապագան

Vera Rubin-ի գալուստով NVIDIA-ն վերասահմանում է, թե ինչպես ենք չափում AI ներդրումների արդյունավետությունը: Ինտելեկտը մեկ դոլարի դիմաց դառնում է որոշիչ չափանիշ, թե որ հարթակը կարող է լավագույնս սպասարկել ագենտային AI-ի դարաշրջանը, որտեղ մոդելները ոչ միայն արձագանքում են հուշումներին, այլ պլանավորում, տրամաբանում, օգտագործում գործիքներ, վերականգնվում ձախողումներից և շարունակաբար կատարելագործվում:

Քանի որ AI մոդելները պարզ հարց-պատասխանից անցնում են բարդ, բազմաքայլ, շարունակաբար հարմարվող վարքագծի, հետվերապատրաստման դերը միայն կաճի: NVIDIA-ի Vera Rubin հարթակը — զուգակցված NeMo գրադարանների, Nemotron 3 Ultra մոդելի և Dynamo ինֆերենսի օրկեստրատորի հետ — ստեղծում է ինտեգրված, ծայրից-ծայր համակարգ, որը առավելագույնի է հասցնում ներդրված յուրաքանչյուր դոլարի ինտելեկտուալ վերադարձը:

Սա AI ենթակառուցվածքի նոր դարաշրջանն է: Հարցն այլևս «քանի GPU ունեմ ես» չէ, այլ «որքան ինտելեկտ եմ ստանում մեկ դոլարի դիմաց»

📖 Աղբյուր