
NVIDIA-მ NodeWright წარადგინა — ღია კოდის პაკეტების მენეჯერი Kubernetes-ის კვანძებისთვის
NVIDIA-მ ღია კოდის ინსტრუმენტი NodeWright წარადგინა — Kubernetes-ისთვის შექმნილი პაკეტების მენეჯერი, რომელიც GPU კლასტერების კვანძების ჰოსტის ოპერაციულ სისტემებს დეკლარატიულად აკონფიგურირებს და განაახლებს დატვირთვების შეწყვეტის გარეშე.
NVIDIA-მ ღია კოდის ინსტრუმენტი NodeWright წარადგინა — Kubernetes-ისთვის შექმნილი პაკეტების მენეჯერი, რომელიც GPU კლასტერების კვანძების ჰოსტის ოპერაციულ სისტემებს დეკლარატიულად აკონფიგურირებს და განაახლებს დატვირთვების შეწყვეტის გარეშე. ის NVIDIA-ში უკვე პროდუქციაში მუშაობს Skyhook-ის სახელით და DSX OS-ის ნაწილია.
სკრიპტებიდან დეკლარატიულ მართვამდე
გუნდები კვანძებს ხშირად Ansible-ის playbook-ებითა და ხელით დაწერილი ინსტრუქციებით მართავენ. ეს მიდგომა ტყდება, როცა ბირთვის განახლება RDMA-ს ართულებს ან CVE ასობით მანქანაზე უნდა გამოსწორდეს. ხანგრძლივი ტრენინგების გადატანა შეუძლებელია — მთავარი ამოცანა მთელი ფლოტის შეცვლაა ტრენინგის შეწყვეტის გარეშე.
როგორ მუშაობს NodeWright
პაკეტები Kubernetes-ის Custom Resource-ებია, ამიტომ ისინი kubectl-ით, Helm-ით ან Argo CD-ით გაეშვება. ოპერატორი ყოველ სამიზნე კვანძზე ფიქსირებულ თანმიმდევრობას ასრულებს: ბლოკავს მას ახალი დატვირთვისთვის (cordon), ელოდება არაშეწყვეტად მონიშნული pod-ების დასრულებას, ათავისუფლებს დანარჩენებს, აყენებს და აკონფიგურირებს პაკეტს, საჭიროების შემთხვევაში სერვისს გადატვირთავს ან კვანძს რებუტავს და ბოლოს კვანძს ხსნის.
პაკეტებს sysctl-ისა და GRUB-ის პარამეტრების დაყენება, უსაფრთხოების აგენტების ინსტალაცია და CVE-ების გამოსწორება შეუძლიათ. NodeWright თითოეული პაკეტის ვერსიას ყოველ კვანძზე ითვალისწინებს და შესრულების რიგს დამოკიდებულებებით განსაზღვრავს. ვალიდაცია ჩაშენებულია: CVE-ის პაკეტს დაუცველი ბირთვის მოდულის აღმოჩენა და თავის ჩავარდნილად მონიშვნა შეუძლია.
უსაფრთხო გავრცელება მასშტაბზე
DeploymentPolicy რესურსი კომპარტამენტებს განსაზღვრავს — ლეიბლებით შერჩეულ კვანძების ჯგუფებს, თითოეულს საკუთარი შეფერხების ბიუჯეტითა და სტრატეგიით: ფიქსირებული ზომის ჯგუფები, წრფივი (1, 2, 3…) და ექსპონენციალური ზრდა (1, 2, 4, 8…). batch threshold წარმატების მინიმალურ მაჩვენებელს განსაზღვრავს, რომლის შემდეგაც გავრცელება შემდეგ ჯგუფზე გადადის; ჩავარდნის ზღვარი ზედიზედ წარუმატებელი ჯგუფების შემდეგ კომპარტამენტს აჩერებს.
რაღაც თუ ჩავარდა, განახლება ჩერდება და არ ვრცელდება: შეცდომები სტატუსში ჩანს, ჩავარდნილი Job-ები მონიშნება. ახალი კვანძები კლასტერს taint-ით შეიძლება შეუერთდნენ — ის მხოლოდ მას შემდეგ მოიხსნება, რაც ყველა პაკეტი და შემოწმება გაივლის.
ეკოსისტემა და ხელმისაწვდომობა
NodeWright ინტეგრირდება NVIDIA AI Cluster Runtime-თან (AICR), რომელიც შემოწმებულ კონფიგურაციებს Helm-ის, Argo CD-ისა თუ Flux-ისთვის მზა რეცეპტებად აქვეყნებს; მასთან ერთად მუშაობს NVCRE და NVSentinel. Apache 2.0 ლიცენზიით გავრცელებული NodeWright Helm-ით, OCI არტეფაქტიდან დაყენდება; tuning პაკეტები Hopper-ისა და Blackwell-ის GPU-ებს, Google Kubernetes Engine-ის კვანძებსა და Amazon EKS-ის კლასტერებს ფარავს.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.