← უკან დაბრუნება
SiTech Team⏱️ 5 წთ. საკითხავი

NVIDIA Vera Rubin GPU არქიტექტურა — 336 მილიარდი ტრანზისტორი, 10x აგენტური გამტარუნარიანობა Blackwell-თან შედარებით

NVIDIA Vera Rubin GPU არქიტექტურა — 336 მილიარდი ტრანზისტორი, 10x აგენტური გამტარუნარიანობა Blackwell-თან შედარებით

NVIDIA-მ წარადგინა Vera Rubin პლატფორმა — 336 მილიარდი ტრანზისტორით, HBM4 მეხსიერებითა და მესამე თაობის Transformer Engine-ით, რომელიც აგენტურ AI დატვირთვებს 10-ჯერ უფრო ეფექტურად ამუშავებს.

აგენტური AI-ს ახალი ერა — NVIDIA Vera Rubin

რამდენიმე წლის წინ, ხელოვნური ინტელექტის სამყარო ძირითადად მოდელების წვრთნასა და მარტივ ჩეთ ინტერფეისებს ემსახურებოდა. დღეს კი სურათი რადიკალურად შეიცვალა — AI ქარხნები მუდმივად მუშაობენ და ინტელექტს მასშტაბურად აწარმოებენ. ეს ქარხნები ახლა აგენტურ სამუშაო ნაკადებს ემსახურებიან, რომლებიც მსჯელობენ, გეგმავენ, იყენებენ ინსტრუმენტებს, ამოწმებენ შუალედურ შედეგებს და ასრულებენ რთულ მრავალსაფეხურიან დავალებებს ვრცელ კონტექსტში.

აგენტური დატვირთვები არ განისაზღვრება ერთი შეკითხვითა და პასუხით — ეს არის უწყვეტი ინფერენცია მრავალი მსჯელობის საფეხურზე. ისინი საჭიროებენ დაბალ ლატენტობას თითო საფეხურზე, მაღალ decode გამტარუნარიანობას, ეფექტურ ხანგრძლივ-კონტექსტიან ყურადღებას (attention), დიდ KV ქეშის ტევადობას და მოდელების მასშტაბირების შესაძლებლობას მჭიდროდ დაკავშირებულ GPU დომენებზე. სწორედ ამ გამოწვევებზე პასუხობს NVIDIA-ს ახალი Vera Rubin პლატფორმა.

Rubin GPU — 336 მილიარდი ტრანზისტორის სიმძლავრე

Vera Rubin პლატფორმის გულში მოთავსებულია NVIDIA Rubin GPU, რომელიც შექმნილია იმისთვის, რომ უზრუნველყოს 10-ჯერ მეტი აგენტური გამტარუნარიანობა ენერგიის ერთეულზე, ვიდრე წინა თაობის NVIDIA Blackwell. ეს არ არის მხოლოდ რიცხვი — ეს არის ფუნდამენტური ნახტომი, რომელიც საშუალებას მისცემს AI ქარხნებს უფრო მეტი სასარგებლო ტოკენი აწარმოონ იმავე ენერგიის ფარგლებში.

Rubin GPU აგებულია 336 მილიარდი ტრანზისტორისგან, მოიცავს 224 სტრიმინგ მულტიპროცესორს (SM) და 896 Tensor Core-ს. ჩიპი დამზადებულია რეტიკულით შეზღუდული (reticle-limited) გამომთვლელი კრისტალებისგან, რომლებიც გაერთიანებულია მაღალსიჩქარიანი NV-HBI (NVIDIA High-Bandwidth Interface) ინტერ-დაის ბმულით. ეს მიდგომა საშუალებას იძლევა მიღწეულ იქნას მაღალი სიმჭიდროვე და ეფექტურობა.

მესამე თაობის Transformer Engine — 50 petaflops NVFP4

ერთ-ერთი მთავარი ინოვაცია Rubin-ში არის მესამე თაობის Transformer Engine. ეს ძრავა ადაპტირებს სიზუსტეს სხვადასხვა რიცხვით ფორმატებს შორის, რაც საშუალებას აძლევს Rubin GPU-ს მიაღწიოს 50 petaflops-მდე NVFP4 ინფერენციის შესრულებას სიზუსტის შენარჩუნებით.

Rubin-ის გაძლიერებული Tensor Cores გააჩნიათ გაფართოებული სიზუსტის მოქნილობა, ხოლო Tensor Core-ის გამტარუნარიანობა საათზე გაორმაგებულია K განზომილებაში მონაცემთა გაორმაგებული დამუშავების წყალობით. ეს ოპტიმიზაცია ეხმარება როგორც გამტარუნარიანობით შეზღუდულ ბირთვებს, ასევე მეხსიერებითა და ლატენტობით შეზღუდულ ბირთვებს.

HBM4 მეხსიერება — 288 GB 22 TB/s გამტარუნარიანობით

Rubin ინტეგრირებს 288 GB-მდე HBM4 მეხსიერებას, რომელსაც ემსახურება სპეციალური HBM კონტროლერები და 12-Hi სტეკები. ეს უზრუნველყოფს 22 TB/s-მდე პიკურ გამტარუნარიანობას — 2.8-ჯერ მეტს Blackwell-თან და Blackwell Ultra-სთან შედარებით.

HBM4-ის მთავარი უპირატესობა ისაა, რომ ის აორმაგებს ინტერფეისის სიგანეს HBM3e-სთან შედარებით. ახალ მეხსიერების კონტროლერთან, მეხსიერების ეკოსისტემასთან ღრმა კო-ინჟინერიასთან და გამოთვლა-მეხსიერების მჭიდრო ინტეგრაციასთან ერთად, ეს სისტემა უზრუნველყოფს უპრეცედენტო გამტარუნარიანობას.

მაღალი ტევადობისა და გამტარუნარიანობის HBM4 კრიტიკულია მრავალტრილიონიანი პარამეტრების მქონე მოდელების ჰოსტინგისთვის, კონტექსტის სიგრძის გაზრდისთვის KV ქეშის offload-ის გარეშე და მაღალი კონკურენტუნარიანობის, ხანგრძლივი ჰორიზონტის ინფერენციის სამუშაო დატვირთვების მხარდასაჭერად.

NVLink 6 და NVLink-C2C — მონაცემთა ულტრა სწრაფი გადაცემა

Rubin-ში კომუნიკაციის ინფრასტრუქტურა ისეთივე მნიშვნელოვანია, როგორც თავად გამოთვლითი ძალა. NVIDIA NVLink 6 უზრუნველყოფს 3,600 GB/s scale-up გამტარუნარიანობას NVLink Switch-ის მეშვეობით ყველას-ყველასთან (all-to-all) GPU-GPU კომუნიკაციისთვის. NVLink-C2C გადასცემს 1,800 GB/s-ს თანმიმდევრული CPU-GPU კომუნიკაციისთვის, ხოლო x16 PCIe Gen 6 უზრუნველყოფს 256 GB/s-მდე ჰოსტის კავშირს.

Rubin ასევე ნერგავს counted writes-ს მოწყობილობის მიერ ინიცირებული NVLink კომუნიკაციისთვის. ეს შესაძლებლობა ამარტივებს სინქრონიზაციას GPU-დან GPU-ზე მონაცემთა გადაცემისთვის, რაც საშუალებას აძლევს მიმღებ GPU-ს უფრო ეფექტურად აკონტროლოს ტრანსფერის დასრულება.

აგენტური AI-სთვის ოპტიმიზირებული არქიტექტურა

Rubin GPU სპეციალურად არის შექმნილი აგენტური AI დატვირთვებისთვის — მსჯელობა, დაგეგმვა, ინსტრუმენტების გამოყენება, გრძელი კონტექსტი. ეს მოითხოვს არა მხოლოდ პიკურ გამოთვლით შესრულებას, არამედ ეფექტურ მონაცემთა გადაადგილებას, ხანგრძლივ-კონტექსტიანი ყურადღების დამუშავებას და დამოკიდებულ ბირთვებს შორის გადასვლებს.

Rubin აჩქარებს attention-ს აქტივაციის sparse-ობისა და ადაპტური კომპრესიის კომბინაციით, გაუმჯობესებულ softmax გამტარუნარიანობასთან ერთად. Attention-ის პიპლაინი იწყება dense QK^T გამოთვლით, რათა წარმოქმნას შუალედური attention ქულები. Rubin-ს შეუძლია ეს მონაცემები Tensor Memory-დან ჩატვირთოს სტრუქტურირებულ 2:4 sparse შეკუმშულ ფორმაში, რაც ამცირებს ქულების ჩაწერის ხარჯსა და შენახვის მოთხოვნებს.

გარდა ამისა, Rubin უზრუნველყოფს უფრო წვრილმარცვლოვან კოორდინაციას დამოკიდებულ ბირთვებს შორის. ეს საშუალებას აძლევს მომხმარებელ ბირთვს დაიწყოს მუშაობა უფრო ადრე, როგორც კი საჭირო შეყვანის მონაცემები ხელმისაწვდომი გახდება, ლოდინის გარეშე მწარმოებლის უფრო დიდი ნაწილის დასრულებამდე.

Vera CPU — Olympus ბირთვები მაქსიმალური შესრულებისთვის

Vera Rubin პლატფორმა ასევე მოიცავს Vera CPU-ს, რომელიც აგებულია Olympus ბირთვებზე, შექმნილი მაქსიმალური single-thread შესრულებისთვის. ეს CPU უზრუნველყოფს მჭიდრო კოორდინაციას GPU-სთან NVLink-C2C-ის მეშვეობით, რაც განსაკუთრებით მნიშვნელოვანია აგენტური სამუშაო ნაკადებისთვის, სადაც CPU და GPU მუდმივად ცვლიან მონაცემებს.

Vera Rubin NVL72 — რეკის მასშტაბის AI სუპერკომპიუტერი

Vera Rubin NVL72 აფართოებს Rubin GPU-ს რეკის მასშტაბის შესრულების დომენად. ეს მესამე თაობის MGX რეკის არქიტექტურა აერთიანებს კაბელების გარეშე გამოთვლით და ქსელის ტრეებს, 45°C თხევად გაგრილებას, დინამიკურ რეკის მასშტაბის ენერგიის მართვას და Intelligent Power Smoothing-ს.

DSX MaxLPS-ით, Vera Rubin NVL72-ს შეუძლია საშუალო ენერგიის მოხმარება შეამციროს დაახლოებით 10%-ით და 50 ms პიკური სიმძლავრე 20%-ით. ეს საშუალებას აძლევს ოპერატორებს იმავე ენერგიის ბიუჯეტში 40%-მდე მეტი GPU დააყენონ. Spectrum-6 ქსელი უზრუნველყოფს გიგასკალურ AI ქარხნების დაკავშირებას.

კონფიდენციალური გამოთვლები TEE-I/O-ით

მასშტაბური აგენტური AI განლაგებისთვის მონაცემთა უსაფრთხოება კრიტიკულია. NVIDIA ნერგავს Confidential Computing-ს TEE-I/O-ით, რომელიც შექმნილია მონაცემების დასაცავად შენახვის, გადაცემისა და გამოყენების დროს AI ქარხანაში.

Bristol Myers Squibb — ყველაზე მოწინავე AI ფაბრიკა

Rubin-ის პლატფორმის რეალური პოტენციალის დემონსტრირებისთვის, Bristol Myers Squibb აშენებს სიცოცხლის მეცნიერების ყველაზე მოწინავე AI ფაბრიკას Rubin-ზე დაყრდნობით. ეს ნაბიჯი ხაზს უსვამს იმას, რომ Vera Rubin არ არის მხოლოდ GPU-ს ახალი თაობა — ის არის პლატფორმა, რომელიც საშუალებას მისცემს მთელ ინდუსტრიებს გადავიდნენ AI-ს გამოყენების შემდეგ დონეზე.

დასკვნა

NVIDIA Vera Rubin GPU არქიტექტურა წარმოადგენს მნიშვნელოვან ნახტომს AI ინფრასტრუქტურის ევოლუციაში. 336 მილიარდი ტრანზისტორით, HBM4 მეხსიერებით, მესამე თაობის Transformer Engine-ითა და 10x აგენტური გამტარუნარიანობით, ის არა მხოლოდ პასუხობს დღევანდელი AI სამუშაო დატვირთვების მოთხოვნებს, არამედ ქმნის საფუძველს ხვალინდელი აგენტური სისტემებისთვის. Vera Rubin-ით, NVIDIA აგრძელებს თავის ხედვას — AI ფაბრიკები, რომლებიც მუშაობენ უწყვეტად, უფრო ეფექტურად, უფრო უსაფრთხოდ და უფრო დიდ მასშტაბზე, ვიდრე ოდესმე.

📖 წყარო