NVIDIA Vera Rubin — ინტელექტი დოლარზე: AI პოსტ-ტრეინინგის ახალი ერა
NVIDIA-ს Vera Rubin პლატფორმა პოსტ-ტრეინინგის ვორკლოდებისთვის 4-ჯერ ნაკლებ GPU-ს მოითხოვს, ვიდრე Blackwell — ეს არის ინტელექტი დოლარზე (intelligence per dollar) მეტრიკის ახალი ეტალონი.
აგენტური AI-ს ახალი ერა: უწყვეტი პოსტ-ტრეინინგი
წარმოიდგინეთ პროფესიონალი სპორტსმენი. ელიტარულ შემსრულებლებს ერთმანეთისგან ის განასხვავებთ, რაც თამაშებს შორის ხდება — მუდმივი გაუმჯობესება, ახალ მოწინააღმდეგეებთან ადაპტაცია, ბოლო მატჩის შეცდომებზე სწავლა. აგენტური AI ზუსტად ასე მუშაობს. მოდელი აღარ უბრალოდ პასუხობს მოთხოვნას — მას ეძლევა მიზანი, რომლის მისაღწევადაც მუდმივად უწევს ადაპტირება, რადგან გარემო იცვლება, ახალი გამოწვევები ჩნდება და ინსტრუმენტებიც განახლდება.
ეს რადიკალურად ცვლის იმას, თუ როგორ ვუყურებთ AI მოდელების მომზადებას. პოსტ-ტრეინინგი (post-training) — ფაზა, რომელიც მოდელს საწყისი მონაცემებით გაწვრთნის შემდეგ აუმჯობესებს — აღარ არის ერთჯერადი დასრულების ნაბიჯი. ის უწყვეტი პროცესია, რადგან აგენტური მოდელების გარემო სწრაფად იცვლება. ინსტრუმენტები შეიძლება კვირიდან კვირამდე შეიცვალოს, წარმოებაში ჩნდება ისეთი გამოწვევები, რაც არც ერთ ტესტირების ნაკრებს არ გაუთვალისწინებია. თითოეული დანერგვა მოაქვს საკუთარ კოდის ბაზას, პოლიტიკებსა და გარემოს.
შედეგი? გამოთვლითი რესურსების მოხმარება იზრდება არა იმიტომ, რომ რომელიმე ერთი გაშვება უფრო დიდია, არამედ იმიტომ, რომ გაშვებები არასდროს ჩერდება. სწორედ ეს ხდის პოსტ-ტრეინინგს აგენტური AI ეპოქის ცენტრალურ ვორკლოდად.
რა არის პოსტ-ტრეინინგი და რატომ აქვს მას მნიშვნელობა
პოსტ-ტრეინინგი არის ის ადგილი, სადაც ინტელექტი იქმნება. წინასწარი მომზადებისას (pre-training) მოდელი სწავლობს შემდეგი ტოკენის წინასწარმეტყველებას — ეს აძლევს მას სითხეს ენაში, მაგრამ არა ინტელექტს. პოსტ-ტრეინინგია ის, როცა მოდელი სწავლობს კოდის წერას, მრავალსაფეხურიანი დავალების დაგეგმვას, საძიებო ინსტრუმენტის გამოყენებას და შეცდომებისგან თავის დაღწევას.
ინფერენსი (inference) — ეს ისაა, რაც მოდელს წარმოებაში აქვს, გაზომილი ღირებულებით თითო ტოკენზე (cost per token). მაგრამ პოსტ-ტრეინინგი სულ სხვაა. რადგან არ არსებობს წინასწარ განსაზღვრული სწორი პასუხი, მხოლოდ ჯილდო (reward), მოდელი სწავლობს განმამტკიცებელი სწავლის (reinforcement learning — RL) ტექნიკებით.
პროცესი ასე მუშაობს: მოდელი იღებს დავალებას, წერს ცდას (forward pass — იგივე სამუშაო, რასაც წარმოებაში აკეთებს), ცდა ფასდება, და შედეგი განაახლებს მოდელის წონებს (backward pass). მილიონობით ცდის შემდეგ, ინტელექტი იზრდება. თითოეული ნაბიჯი გამოთვლითად ინტენსიურია, და ამ ციკლის მასშტაბირება ორკესტრირების პრობლემაა: ათასობით გარემო, რომელიც პარალელურად ქმნის rollouts-ებს, ჯილდოების ვერიფიკაცია, და განახლებული წონები, რომლებიც უკან მიედინება ტრეინინგში.
ინტელექტი დოლარზე — ახალი მეტრიკა AI ინვესტიციისთვის
თუ ინფერენსი შემოსავლის ძრავაა, პოსტ-ტრეინინგი მულტიპლიკატორია: რაც უფრო ქმედუნარიანია მოდელი, მით უფრო მაღალია თითოეული ტოკენის ღირებულება. Cost per token — ინფერენსის ფაბრიკის მთავარი მეტრიკაა: 1 მილიონი ტოკენის მიწოდების სრული ღირებულება.
ინტელექტი დოლარზე (intelligence per dollar) ერთი დონით ზემოთ დგას და პასუხობს სხვა კითხვას: რა ღირს ისეთი მოდელის აშენება, რომლის სერვისად გამოყენებაც ღირს — და მისი მუდმივი გაუმჯობესება. ეს ორი მეტრიკა ერთმანეთს არ ეჯიბრება, ისინი ჩადებულია ერთმანეთში. AI ინფრასტრუქტურა, რომელიც ამცირებს cost per token-ს, ასევე ამცირებს მოდელში ინტელექტის თითოეული წერტილის ჩაშენების ღირებულებას. და ინტელექტის თითოეული წერტილი ზრდის იმ ტოკენების ღირებულებას, რომელსაც ინფერენსის ფაბრიკა ემსახურება.
სხვა სიტყვებით: cost per token ზომავს ოპერაციულ შემოსავალს; intelligence per dollar ზომავს, იხდის თუ არა მოდელის ინტელექტში ინვესტიცია თავს.
Vera Rubin — 4-ჯერ ნაკლები GPU, მაქსიმალური ინტელექტი
NVIDIA-ს Blackwell პლატფორმამ უკვე შეამცირა გაშვების ღირებულება, რაც აგენტური ეპოქის ხშირი პოსტ-ტრეინინგს ეკონომიკურად შესაძლებელს ხდის. მაგრამ Vera Rubin ამ ტრაექტორიას კიდევ უფრო წინ წევს — ის ყველაზე დიდ მოდელებს Blackwell-ის თაობის GPU-ების მეოთხედით აწვრთნის.
Vera Rubin თავიდან ბოლომდე იყო კოდიზაინირებული (codesigned) იმისთვის, რომ მაქსიმუმამდე გაეზარდა intelligence per dollar აგენტური AI პოსტ-ტრეინინგის ვორკლოდებისთვის: მეტი rollout თითოეულ გაშვებაში, მეტი გარემო ერთდროულად, და პოსტ-ტრეინინგის ციკლები, რომლებიც არასდროს ჩერდება.
ეს განსაკუთრებით მნიშვნელოვანია იმ კონტექსტში, რომ cost per token-ის ყოველი გაუმჯობესება პირდაპირ აისახება intelligence per dollar-ზე. ვინაიდან forward pass (ცდა) ინფერენსია, რომელიც cost per token-ით იზომება, ნებისმიერი წინსვლა ინფერენსის ეფექტურობაში პირდაპირ ზრდის ინტელექტის წარმოებას ყოველ დახარჯულ დოლარზე.
Nemotron 3 Ultra — 550B პარამეტრის ღია მოდელი
NVIDIA-ს Nemotron 3 Ultra — ღია წონების მქონე (open-weight) 550-მილიარდიანი პარამეტრის მიქს-ოფ-ექსპერტთა (MoE) მოდელი — გთავაზობთ ვერიფიცირებად ბენჩმარკებს და სრულად გამოქვეყნებულ პოსტ-ტრეინინგის რეცეპტს, რომელიც გაშვებულია NeMo RL-ზე. მან მიიღო 71.7% SWE-bench verified-ზე — რეალური კოდირების ბენჩმარკზე, სადაც მან შეცდომის გამოსწორება მოახერხა დაახლოებით 7-დან 10-მდე რეალურ პროგრამულ bug-ზე ღია წყაროს პროექტებიდან, თითოეული შემოწმებული იმ პროექტის საკუთარი ტესტებით.
Nemotron 3 Ultra-ს პოსტ-ტრეინინგისთვის გამოყენებული იქნა დაახლოებით 20 მილიარდი rollout ტოკენი, წინა თაობის Nemotron 3 Super-ის ~1.2 მილიონი rollout-ისა და ~10,000 ტოკენის სკალირებით. მნიშვნელოვანია, რომ intelligence per dollar-ის თანაფარდობა პლატფორმებს შორის დამოუკიდებელია ამ დაშვებისგან; აბსოლუტური მნიშვნელობები იცვლება ტოკენების რაოდენობასთან ერთად.
NeMo, Dynamo და AI ეკოსისტემა
NVIDIA-ს NeMo ღია ბიბლიოთეკები — როგორიცაა NeMo Gym (სატრენინგო გარემოსთვის) და NeMo RL (დისტრიბუცირებული პოსტ-ტრეინინგისთვის) — პოსტ-ტრეინინგს ხელოსნური კვლევითი კოდიდან გადააქვს განმეორებად ინფრასტრუქტურად.
ამ ეკოსისტემას უკვე იყენებენ წამყვანი AI კომპანიები:
- Prime Intellect — მათი Lab პლატფორმა უწყვეტად ახდენს ფრონტირის მოდელების პოსტ-ტრეინინგს NVIDIA Blackwell-ზე. Prime Intellect-მა აჩვენა, რომ NVIDIA Vera CPU-ები უზრუნველყოფენ 30%-ით მეტ გამტარუნარიანობას თითო CPU-ზე ალტერნატიულ x86 არქიტექტურასთან შედარებით.
- Perplexity — მათი RL პოსტ-ტრეინინგის სტეკი მუშაობს ასინქრონულად ასობით NVIDIA GPU-ზე, RDMA-ზე დაფუძნებული წონების გადაცემის ძრავით, რომელიც ტრილიონ-პარამეტრიან მოდელებს 2 წამზე ნაკლებ დროში ასინქრონებს ტრეინინგსა და ინფერენსის კვანძებს შორის.
- Together AI — გთავაზობთ პოსტ-ტრეინინგს როგორც სერვისს (post-training as a service) SFT, RL და DPO ტექნიკებით, და გეგმავს Vera Rubin პლატფორმაზე გადასვლას.
უწყვეტი სწავლის მომავალი
Vera Rubin-ის გამოშვებით, NVIDIA ქმნის ახალ სტანდარტს, თუ როგორ უნდა ვიფიქროთ AI ინვესტიციის ეფექტურობაზე. ინტელექტი დოლარზე (intelligence per dollar) ხდება ის მეტრიკა, რომელიც განსაზღვრავს, რომელი პლატფორმაა ყველაზე ქმედუნარიანი აგენტური AI-ს ეპოქაში.
როდესაც AI მოდელები გადადიან მარტივი პასუხის გაცემიდან რთულ, მრავალსაფეხურიან, მუდმივად ადაპტირებად ქცევაზე — პოსტ-ტრეინინგის როლი მხოლოდ გაიზრდება. NVIDIA-ს Vera Rubin პლატფორმა, NeMo ბიბლიოთეკებთან, Nemotron 3 Ultra მოდელთან და Dynamo ინფერენსის ორკესტრატორთან ერთად, ქმნის ინტეგრირებულ, ბოლოდან-ბოლომდე სისტემას, რომელიც მაქსიმუმამდე ზრდის ყოველი ინვესტირებული დოლარის ინტელექტუალურ დაბრუნებას.
ეს არის AI ინფრასტრუქტურის ახალი ერა — სადაც მთავარი კითხვა აღარ არის "რამდენი GPU მაქვს?", არამედ "რამდენ ინტელექტს ვიღებ თითოეულ დახარჯულ დოლარზე?"