
Ai2 ცვლის პრიორიტეტებზე დაფუძნებულ GPU-ს დამგეგმავს ბიუჯეტისა და სამართლიანი წილის სისტემით
Allen Institute for AI (Ai2) კლასტერის პრიორიტეტებზე დაფუძნებული განრიგებელი შეცვალა GPU-დროის ბიუჯეტებით, იერარქიული სამართლიანი წილითა და დროის დაყოფის კონტრაქტით, დებაგის ლოდინი საათებიდან წამებამდე შემცირდა.
პრიორიტეტებიდან ბიუჯეტებამდე
Ai2 მართავს 88-დან 1024-მდე GPU-ის კლასტერებს დაახლოებით 150 შიდა მკვლევრისთვის, რომლებიც დიდ ენობრივ და ხედვა-ენის მოდელებს, რობოტიკის განმტკიცებით სწავლებასა და სამეცნიერო აგენტური გამოყენებების შემდგომ წვრთნას ავითარებენ. GPU-დროზე მოთხოვნა მიწოდებას ორ-სამჯერ აღემატება.
ძველი განრიგებელი პრიორიტეტებსა და არასავალდებულო პრეემპციას ეყრდნობოდა. მომხმარებლები უსარგებლო დატვირთვებით იკავებდნენ ადგილს დებაგისთვის, დაგეგმილი დატვირთვების 100 პროცენტი HIGH პრიორიტეტზე იყო, მორიგე ინჟინრები კი დროს მომსახურებას საჭირო ჰოსტებზე არაპრეემპტირებადი ამოცანების ხელით შეჩერებაზე ხარჯავდნენ.
ახალი მოდელი GPU-დროს ინვესტიციად განიხილავს. მენეჯერები ბიუჯეტებს პროექტებსა და მკვლევრებს შორის დატვირთვების არსებობამდე ანაწილებენ, რითაც სტრატეგიას სიმძლავრის გარანტირებულ წილად აქცევენ. ყველა მოთხოვნა ბიუჯეტით უნდა იყოს დაფინანსებული, თორემ პრეემპციისგან დაცული არ იქნება, რაც ადგილის დაკავებას ძვირს ხდის.
სამართლიანი წილის განრიგება და დროის დაყოფის კონტრაქტი
იერარქიული სამართლიანი წილის განრიგებელი, რომლის ფესვებიც 2009 წლის Hadoop Fair Scheduler-შია და დღეს SLURM-სა და YARN-ში გამოიყენება, დაკავებულობას მოძრავ შვიდდღიან ფანჯარაში აკვირდება და ნაკლებად გამოყენებული გამოყოფების დატვირთვებს უფრო გამოყენებულზე მაღლა ალაგებს. ხე კვლევითი პროგრამის სტრუქტურას იმეორებს, წონები კი მენეჯერების ბიუჯეტებია და არა სტატიკური კვოტები.
განრიგებელი გამოყოფილ დაკავებულობას, რომელიც ბიუჯეტიდან ირიცხება და მინიმალური მუშაობის ფანჯარაში დაცულია, გამოუყოფელისგან განასხვავებს, რომელიც უფასოა, მაგრამ პრეემპტირებადი. კონტრაქტი მოითხოვს მინიმალური მუშაობის დროის გამოცხადებას, მაქსიმუმ 8 საათს, რომლის განმავლობაშიც შეწყვეტა შეუძლებელია. შემდეგ გაგრძელებადი დატვირთვები ავტომატურად ბრუნდება რიგში, რათა სამართლიანი წილი დასტაბილურდეს და არაჯანსაღი ჰოსტები ავტომატური შეკეთებისთვის გათავისუფლდეს.
შედეგები და ღია გამოწვევები
30-დღიან ტესტში გუნდებმა კუთვნილი GPU-საათების 98 პროცენტი მიიღეს; 15 გუნდის გამოყოფიდან 13-მა 95 პროცენტი ან მეტი, ყველაზე ცუდი შემთხვევა კი 90 პროცენტი იყო. კლასტერის დაკავებულობა 98 პროცენტზე შენარჩუნდა, მიწოდებული GPU-დროის 18 პროცენტი გამოუყოფელი დარჩა, რათა აპარატურა დატვირთული ყოფილიყო, როცა დაფინანსებული დატვირთვები მზად არ იყო.
დებაგის დატვირთვებზე p90 რიგში ლოდინი 2 საათიდან 30 წამამდე დაეცა, რაც 6 საათიდან 5 წუთამდე სიმულაციურ პროგნოზს აჯობა. ყველაზე დიდ H100 კლასტერზე მედიანა 5 წუთიდან 24 წამამდე, p90 კი 2,8 საათიდან 1,8 საათამდე შემცირდა. ადამიანის ჩართვას საჭირო შეკეთებები 74 პროცენტით შემცირდა.
ყველა გამოყენება არ გაუმჯობესდა. ინტერაქტიული ანალიზის სესიები, რომლებსაც მკვლევრები ერთ კვირამდე ინახავდნენ, 8-საათიანი დაცული ლიმიტის შემდეგ პრეემპტირებადი გახდა და მომხმარებლებს ცვალებადი მდგომარეობის ხელით აღდგენა უწევთ. Ai2 ახლა CPU-მხოლოდ კლასტერს ავითარებს დეველოპმენტის სესიებისთვის და გეგმავს აღდგენად სესიებს, რათა შეწყვეტილი სამუშაო სხვაგან გაგრძელდეს. გუნდი იკვლევს სიმძლავრის ფრაგმენტაციას, რამაც შეიძლება გაზარდოს ლოდინი დიდ დატვირთვებზე, და ამბობს, რომ შემდეგი ფოკუსი გამოყენების ხარისხია: bootstrapping-ის, checkpointing-ისა და წვრთნის აპლიკაციების მაქსიმალურად ეფექტურად ქცევა.
წყაროები: Hugging Face Blog
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.