
NVIDIA TensorRT-in çoxqurğulu inferensini Dynamo-Triton-a keçirib
Dynamo-Triton 26.07 tək Triton model nüsxəsinə bir neçə GPU-ya sahib olmağa imkan verir; Cosmos 3 Nano video generasiyası səkkiz GPU-da 156,6 saniyədən 34,2 saniyəyə düşüb.
NVIDIA TensorRT-in çoxqurğulu inferens imkanını Dynamo-Triton-a inteqrasiya edib, beləliklə tətbiq artıq GPU sıralarını özü əlaqələndirmir.
Nə dəyişdi
TensorRT-in çoxqurğulu inferensi tək bir şəbəkəyə NCCL əsaslı paylanmış kollektivlər vasitəsilə bir neçə GPU üzərində işləməyə imkan verir və inferens optimallaşdırmalarını saxlayır. Əvvəlki adı Triton Inference Server olan Dynamo-Triton bu imkanı 26.07 buraxılışında işə salır və tək KIND_MODEL nüsxəsi bir neçə GPU-ya sahib ola bilər: icra kontekstləri, CUDA axınları və NCCL kommunikatorları yaradır, sonra hər sorğuda sıraları tək gRPC çağırışı ilə birlikdə işə salır.
Xidmət yolu necə işləyir
İnteqrasiya Cosmos 3 Nano video generasiyası ilə nümayiş etdirilib: Diffusers mühiti idarə edir, Dynamo-Triton isə 36 qatlı səs-küy azaltma transformerinə xidmət göstərir. Ulysses kontekst paralelliyi ilə 44 160 video tokeni səkkiz GPU-ya qədər paylaşdırılır.
Paylanmış qraf yerləşdirmədən əvvəl hər TensorRT planına kompilyasiya olunur, yəni Triton təkqurğulu mühərriki çevirmir, kontekst-paralel planı aktivləşdirir. Bir GPU-da transformer generasiya vaxtının 93.4%-ni təşkil edir və 35 səs-küy azaltma addımının hər biri classifier-free guidance üçün iki proqnoz tələb etdiyindən proksi hər generasiya üçün 70 transformer RPC-si edir.
Gecikmə nəticələri
Dörd variant da eyni səkkiz GPU-lu sistemdə işlədilib: 1280x720, 24 FPS-də 189 kadr və beş ölçülmüş generasiya. Ucdan-uca gecikmə bir GPU-da 156.595 saniyədən ikidə 87.999, dörddə 53.093 və səkkizdə 34.183 saniyəyə düşüb — 78.17% azalma. Transformer RPC vaxtı 83.59% azalıb, payı 93.4%-dən 70.2%-ə enib, bu yoldan kənar vaxt isə bütün konfiqurasiyalarda 10.2–10.5 saniyə aralığında qalıb.
Yoxlama eyni seed ilə hər kontekst-paralel nəticəni təkqurğulu nəticə ilə müqayisə edib: CP2 və CP4 orta mütləq xəta 12.759 və PSNR 21.111 dB göstərib, CP8 isə MAE 16.316 və PSNR 19.400 dB qeyd edib; hamısı müəyyən edilmiş hədlər daxilindədir. NVIDIA nəticələrin piksel səviyyəsində eyni olduğunu iddia etmir.
Güzəştlər
Komandalar yenə də əlavə GPU resursu ilə daha qısa gecikmə arasında seçim etməlidir. Benchmark eyni vaxtlı sorğu məhsuldarlığını, bir videonun dəyərini və ya ümumi sahiblik dəyərini ölçmür; bu göstəricilər öz SLO-ları ilə müqayisə edilməlidir. Dynamo-Triton 26.07 NGC-dən əldə edilə bilər.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.