Վերադառնալ
SiTech Team⏱️ 5 წთ. საკითხავი

NVIDIA Vera Rubin GPU ճարտարապետություն — 336 միլիարդ տրանզիստոր, 10x ավելի բարձր ագենտային թողունակություն՝ համեմատած Blackwell-ի հետ

NVIDIA Vera Rubin GPU ճարտարապետություն — 336 միլիարդ տրանզիստոր, 10x ավելի բարձր ագենտային թողունակություն՝ համեմատած Blackwell-ի հետ

NVIDIA-ն ներկայացրեց Vera Rubin պլատֆորմը՝ 336 միլիարդ տրանզիստորով, HBM4 հիշողությամբ և Transformer Engine-ի երրորդ սերնդով, որն ապահովում է մինչև 10 անգամ ավելի բարձր ագենտային թողունակություն էներգիայի միավորի հաշվով՝ համեմատած Blackwell-ի հետ՝ ագենտային AI բեռնվածքների համար:

Ագենտային AI-ի նոր դարաշրջանը — NVIDIA Vera Rubin

Մի քանի տարի առաջ արհեստական ինտելեկտի աշխարհը հիմնականում սպասարկում էր մոդելների ուսուցումն ու պարզ զրուցարանային ինտերֆեյսները: Այսօր պատկերը արմատապես փոխվել է. AI գործարաններն աշխատում են անընդհատ՝ մասշտաբով ինտելեկտ արտադրելով: Այս գործարաններն այժմ սպասարկում են ագենտային աշխատանքային հոսքեր, որոնք տրամաբանում են, պլանավորում, օգտագործում գործիքներ, ստուգում միջանկյալ արդյունքներ և կատարում բարդ բազմաքայլ առաջադրանքներ լայն կոնտեքստներում:

Ագենտային բեռնվածքները չեն սահմանվում մեկ հարցով ու պատասխանով. դրանք շարունակական ինֆերենցիա են բազմաթիվ տրամաբանման քայլերի միջով: Դրանք պահանջում են ցածր լատենտություն յուրաքանչյուր քայլում, բարձր decode թողունակություն, արդյունավետ երկար-կոնտեքստային ուշադրություն, մեծ KV քեշի տարողություն և մոդելների մասշտաբավորման հնարավորություն սերտորեն կապված GPU տիրույթներում: Հենց այս մարտահրավերներին է պատասխանում NVIDIA-ի նոր Vera Rubin պլատֆորմը:

Rubin GPU — 336 միլիարդ տրանզիստորի հաշվողական խտություն

Պլատֆորմի սրտում գտնվում է NVIDIA Rubin GPU-ն, որը նախագծված է ապահովելու մինչև 10 անգամ ավելի բարձր ագենտային թողունակություն էներգիայի միավորի հաշվով, քան NVIDIA Blackwell-ը: Սա պարզապես թիվ չէ. սա հիմնարար սերնդային թռիչք է, որը թույլ կտա AI գործարաններին ավելի շատ օգտակար token արտադրել նույն էներգիայի սահմաններում:

Rubin GPU-ն կառուցված է 336 միլիարդ տրանզիստորից, ներառում է 224 սթրիմինգ մուլտիպրոցեսոր (SM) և 896 Tensor Core: Չիպը պատրաստված է ռետիկուլով սահմանափակված հաշվողական բյուրեղներից, որոնք միավորված են մեկ փաթեթում բարձրարագ NV-HBI (NVIDIA High-Bandwidth Interface) միջբյուրեղային կապի միջոցով: Այս մոտեցումը ապահովում է բարձր խտություն և արդյունավետություն:

Transformer Engine-ի երրորդ սերունդ — 50 petaflops NVFP4

Rubin-ի գլխավոր նորարարություններից մեկը Transformer Engine-ի երրորդ սերունդն է: Այս շարժիչը հարմարեցնում է ճշգրտությունը տարբեր թվային ձևաչափերի միջև՝ թույլ տալով Rubin GPU-ին հասնել մինչև 50 petaflops NVFP4 ինֆերենցիայի կատարողականի՝ պահպանելով ճշգրտությունը:

Ընդլայնված Tensor Core-ներն ունեն ճշգրտության ընդլայնված ճկունություն, իսկ Tensor Core-ի թողունակությունը ժամացույցի վրա կրկնապատկվել է K չափման տվյալների մշակման կրկնապատկման շնորհիվ: Այս օպտիմիզացիան օգնում է ինչպես թողունակությամբ սահմանափակված միջուկներին, այնպես էլ հիշողությամբ և լատենտությամբ սահմանափակված միջուկներին:

HBM4 հիշողություն — 288 ԳԲ 22 ՏԲ/վ թողունակությամբ

Rubin-ը ինտեգրում է մինչև 288 ԳԲ HBM4 հիշողություն՝ կառավարվող հատուկ HBM կարգավորիչներով և 12-Hi ստեկներով, ապահովելով մինչև 22 ՏԲ/վ պիկ թողունակություն՝ 2.8 անգամ ավելի, քան Blackwell-ը և Blackwell Ultra-ն:

HBM4-ը կրկնապատկում է ինտերֆեյսի լայնությունը՝ համեմատած HBM3e-ի հետ: Նոր հիշողության կարգավորիչի, հիշողության էկոհամակարգի հետ խորհրդատու ինժեներության և հաշվարկ-հիշողության ավելի սերտ ինտեգրման հետ միասին, այս համակարգը ապահովում է աննախադեպ թողունակություն:

Բարձր տարողության և թողունակության HBM4-ը կարևոր է բազմատրիլիոն պարամետրերով մոդելների տեղակայման, KV քեշի offload-ի առանց կոնտեքստի երկարության ընդլայնման և բարձր կոնկուրենտ, երկար հորիզոնի ինֆերենցիայի բեռնվածքների աջակցման համար:

NVLink 6 և NVLink-C2C — գերարագ ինտերկոնեկտներ

Rubin ճարտարապետությունում կոմունիկացիոն ենթակառուցվածքը նույնքան կարևոր է, որքան հաշվողական ուժը: NVIDIA NVLink 6-ն ապահովում է 3,600 ԳԲ/վ scale-up թողունակություն NVLink Switch-ին բոլոր-բոլորին GPU-GPU կապի համար: NVLink-C2C-ն ապահովում է 1,800 ԳԲ/վ կոհերենտ CPU-GPU կապի համար, իսկ x16 PCIe Gen 6-ը՝ մինչև 256 ԳԲ/վ հոսթային կապ:

Rubin-ը ներմուծում է counted writes սարքի կողմից նախաձեռնված NVLink կապի համար՝ հեշտացնելով սինխրոնիզացիան GPU-ից GPU տվյալների փոխանցման համար: Սա թույլ է տալիս ստացող GPU-ին ավելի արդյունավետ հետևել փոխանցման ավարտին:

Ճարտարապետություն՝ օպտիմիզացված ագենտային AI-ի համար

Rubin GPU-ն հատուկ նախագծված է ագենտային AI-ի կատարման ձևերի համար՝ տրամաբանում, պլանավորում, գործիքների օգտագործում և երկար կոնտեքստի մշակում: Սա պահանջում է ոչ միայն պիկ հաշվողական կատարողական, այլև արդյունավետ տվյալների տեղաշարժ, երկար-կոնտեքստային ուշադրության մշակում և կախյալ միջուկների միջև սահուն անցումներ:

Rubin-ն արագացնում է ուշադրությունը՝ միավորելով ակտիվացման սակավությունը հարմարվողական սեղմման հետ՝ բարելավված softmax թողունակության հետ միասին: Ուշադրության փողոցը սկսվում է խիտ QK^T հաշվարկով՝ միջանկյալ ուշադրության գնահատականներ ստանալու համար: Rubin-ը կարող է այդ միջանկյալ տվյալները Tensor Memory-ից բեռնել կառուցվածքային 2:4 սակավ սեղմված ձևով՝ նվազեցնելով գրելու ծախսը և պահպանման պահանջները:

Բացի այդ, Rubin-ն ապահովում է ավելի մանրահատիկ համակարգում կախյալ միջուկների միջև՝ թույլ տալով սպառող միջուկին սկսել աշխատել ավելի վաղ, հենց որ անհրաժեշտ մուտքային տվյալները հասանելի դառնան:

Vera CPU — Olympus միջուկներ առավելագույն կատարողականի համար

Vera Rubin պլատֆորմը ներառում է նաև Vera CPU, որը կառուցված է Olympus միջուկների վրա՝ նախագծված առավելագույն մեկ-թելային կատարողականի համար: Այս CPU-ն ապահովում է սերտ համակարգում GPU-ի հետ NVLink-C2C-ի միջոցով, ինչը հատկապես կարևոր է ագենտային աշխատանքային հոսքերի համար, որտեղ CPU-ն և GPU-ն անընդհատ տվյալներ են փոխանակում:

Vera Rubin NVL72 — դարակային մասշտաբի AI սուպերհամակարգիչ

Vera Rubin NVL72-ն ընդլայնում է Rubin GPU-ն դարակային մասշտաբի կատարման տիրույթում: MGX-ի երրորդ սերնդի դարակային ճարտարապետությունը միավորում է առանց մալուխների հաշվողական և ցանցային սկուտեղները, 45°C հեղուկ սառեցումը, դինամիկ դարակային մասշտաբի էներգիայի կառավարումը և Intelligent Power Smoothing-ը:

DSX MaxLPS-ով, Vera Rubin NVL72-ը կարող է նվազեցնել էներգիայի միջին սպառումը մոտավորապես 10%-ով և 50 ms պիկ հզորությունը մոտ 20%-ով: Սա թույլ է տալիս օպերատորներին տեղադրել մինչև 40% ավելի շատ GPU նույն էներգիայի բյուջեում: Spectrum-6 ցանցն ապահովում է գիգամասշտաբային AI գործարանների միացումը:

Գաղտնի հաշվարկներ TEE-I/O-ով

Խոշոր մասշտաբի ագենտային AI տեղակայումների համար տվյալների անվտանգությունը կարևոր է: NVIDIA-ն ներկայացնում է Գաղտնի Հաշվարկներ TEE-I/O-ով, որը նախագծված է տվյալները պաշտպանելու համար պահպանման, փոխանցման և օգտագործման ժամանակ AI գործարանում:

Bristol Myers Squibb — կյանքի գիտության ամենաառաջադեմ AI գործարանը

Rubin պլատֆորմի իրական ներուժը ցուցադրելու համար, Bristol Myers Squibb-ը կառուցում է կյանքի գիտության ամենաառաջադեմ AI գործարանը Rubin-ի հիմքի վրա: Այս քայլը ընդգծում է, որ Vera Rubin-ը պարզապես GPU-ի նոր սերունդ չէ. այն պլատֆորմ է, որը թույլ կտա ամբողջ ոլորտներին անցնել AI-ի ընդունման հաջորդ մակարդակին:

Եզրակացություն

NVIDIA Vera Rubin GPU ճարտարապետությունը նշանակալի պահ է AI ենթակառուցվածքի էվոլյուցիայում: 336 միլիարդ տրանզիստորով, HBM4 հիշողությամբ, Transformer Engine-ի երրորդ սերնդով և Blackwell-ի համեմատ 10 անգամ ավելի բարձր ագենտային թողունակությամբ, այն ոչ միայն բավարարում է ժամանակակից AI բեռնվածքների պահանջները, այլև հիմք է ստեղծում ապագայի ագենտային համակարգերի համար: Աջակցված 300 գլոբալ գործընկերների և խոշոր ամպային մատակարարների՝ CoreWeave, Google Cloud, Microsoft Azure և Mistral, Vera Rubin-ն արդեն տեղակայվում է ամբողջ աշխարհում: Vera Rubin-ով NVIDIA-ն շարունակում է իր տեսլականը AI գործարանների, որոնք աշխատում են անընդհատ, ավելի արդյունավետ, ավելի անվտանգ և ավելի մեծ մասշտաբով, քան երբևէ:

📖 Աղբյուր