← უკან დაბრუნება
SiTech Team⏱️ 2 წთ. საკითხავი

NVIDIA ModelExpress — AI მოდელების განაწილება სინათლის სიჩქარით GPU კლასტერებზე

NVIDIA ModelExpress — AI მოდელების განაწილება სინათლის სიჩქარით GPU კლასტერებზე

NVIDIA-მ ModelExpress წარადგინა — სისტემა, რომელიც AI მოდელების წონებს GPU-დან GPU-ზე გადასცემს P2P RDMA-ით. DeepSeek-V4 Pro-ს ჩატვირთვა 8 წუთიდან 1:44-მდე შემცირდა.

NVIDIA ModelExpress — მოდელების განაწილების ახალი ერა

რაც უფრო იზრდება AI მოდელები, მით უფრო კრიტიკული ხდება მათი წონების ეფექტური განაწილება. DeepSeek-V4 Pro-ს მსგავსი მოდელები ასობით გიგაბაიტს იკავებს. NVIDIA-მ ModelExpress (MX) წარადგინა — ახალი სისტემა, რომელიც რადიკალურად ცვლის AI მოდელების წონების GPU კლასტერებზე განაწილების მიდგომას. მთავარი იდეა გასაოცრად მარტივია: სანამ მოდელს ჩატვირთავთ, ჯერ გაარკვიეთ, სად არსებობს უკვე მისი თავსებადი ასლი.

როგორ მუშაობს ModelExpress

როდესაც serving peer-ს უკვე გააჩნია თავსებადი წონები GPU-ში, MX მათ პირდაპირ GPU-დან GPU-ზე გადასცემს P2P RDMA-ით NVIDIA Inference Xfer Library-ის (NIXL) მეშვეობით. MX DeepSeek-V4 Pro-ს წონებსა და JIT Kernel ქეშს ერთი რეპლიკიდან მეორეში 10 წამზე ნაკლებ დროში გადასცემს — 8 წუთის ნაცვლად. საერთო ჩატვირთვის დრო 8 წუთიდან 1 წუთამდე 44 წამამდე შემცირდა.

სამი გზა GPU მეხსიერებამდე

ყოველი ახალი მუშა იღებს წონებს სამი წყაროდან: დისტანციური საცავი (HF ან S3), ლოკალური საცავი, ან სხვა მუშა, რომელიც უკვე ემსახურება მოდელს. MX იყენებს Model Streamer-ს დისტანციური ობიექტების ნაკადისთვის, GPU Direct Storage (GDS) ლოკალური საცავისთვის.

P2P RDMA: ყველაზე სწრაფი გზა

როდესაც პირველი მუშა იწყებს მუშაობას, სასურველი წყარო იცვლება. მისი წონები უკვე ჩატვირთული, დამუშავებული და GPU მეხსიერებაშია განლაგებული. MX ეს გადასვლას ავტომატურად ახდენს.

RL Post-Training და JIT ქეშის გამოყენება

MX იგივე მიდგომას იყენებს RL post-training დავალებებზე. MX ასევე იყენებს JIT kernel ქეშებს, რაც ძვირადღირებულ რეკომპილაციას გამორიცხავს.

კონტროლის პლანი

MX იყენებს Redis-ს ან Kubernetes-ის მეტამონაცემებს თავსებადი წონების წყაროების აღმოსაჩენად. კონტროლის კომპონენტი პრიორიტეტების ჯაჭვს მიჰყვება.

დასკვნა

NVIDIA ModelExpress წყვეტს ფუნდამენტურ ინფრასტრუქტურულ პრობლემას. 8 წუთიდან 2 წუთამდე ჩატვირთვის დროის შემცირებით, AI ინფრასტრუქტურა უფრო ეფექტური ხდება.

📖 წყარო