Geri Dön
NVIDIA, TensorRT çok cihazlı çıkarımı Dynamo-Triton'a taşıdı
SiTech AI Team2 წთ. საკითხავი

NVIDIA, TensorRT çok cihazlı çıkarımı Dynamo-Triton'a taşıdı

Dynamo-Triton 26.07, tek bir Triton model örneğinin birkaç GPU'ya sahip olmasını sağlıyor; Cosmos 3 Nano video üretimi sekiz GPU'da 156,6 saniyeden 34,2 saniyeye indi.

NVIDIA, TensorRT'nin çok cihazlı çıkarım yeteneğini Dynamo-Triton'a ekledi; artık uygulamanın GPU sıralamalarını kendi başına koordine etmesi gerekmiyor.

Ne değişti

TensorRT çok cihazlı çıkarım, tek bir TensorRT ağının NCCL tabanlı dağıtık kolektiflerle birden fazla GPU üzerinde çalışmasını sağlarken çıkarım optimizasyonlarını koruyor. Eski adı Triton Inference Server olan Dynamo-Triton bu yeteneği 26.07 sürümünde açıyor ve tek bir Triton KIND_MODEL örneği artık birden fazla GPU'ya sahip olabiliyor: her sıra için yürütme bağlamları, CUDA akışları ve NCCL iletişimcileri oluşturup her istekte sıralamaları tek bir gRPC çağrısıyla birlikte başlatıyor.

Diffusers, Triton Inference Server ve TensorRT çok cihazlı iş akışı

Sunum yolu nasıl işliyor

Entegrasyon Cosmos 3 Nano video üretimiyle gösterildi: Diffusers ortamı yönetmeye devam ederken Dynamo-Triton 36 katmanlı gürültü giderme transformatörünü sunuyor. TensorRT çok cihazlı çıkarım, Ulysses bağlam paralelliğiyle 44.160 video tokenını sekiz GPU'ya kadar dağıtıyor.

Dağıtık grafik, dağıtımdan önce her TensorRT planına derleniyor; yani Triton tek cihazlı bir motoru dönüştürmek yerine bağlam paralel bir planı etkinleştiriyor. Transformatör, tek GPU'daki üretim süresinin %93.4'ünü oluşturuyor ve 35 gürültü giderme adımının her biri classifier-free guidance için iki tahmin gerektirdiğinden Diffusers vekili üretim başına 70 transformatör RPC'si yapıyor.

Gecikme sonuçları

Dört varyant da aynı sekiz GPU'lu sistemde çalıştı: 1280x720, 24 FPS'te 189 kare ve beş ölçülen üretim. Uçtan uca gecikme tek GPU'da 156.595 saniyeden iki GPU'da 87.999'a, dörtte 53.093'e ve sekizde 34.183 saniyeye düştü; bu %78.17'lik azalma. Transformatör RPC süresi %83.59 azaldı, payı %93.4'ten %70.2'ye indi ve bu yol dışındaki süre tüm yapılandırmalarda 10.2-10.5 saniye aralığında kaldı.

Uçtan uca gecikmenin GPU yapılandırmalarına göre dağılımı

Doğrulama, aynı seed ile her bağlam paralel çıktıyı tek cihazlı sonuçla karşılaştırdı: CP2 ve CP4 ortalama mutlak hata 12.759 ve 21.111 dB PSNR ölçtü, CP8 ise MAE 16.316 ve PSNR 19.400 dB verdi; tümü belirlenen eşiklerin içinde. NVIDIA çıktıların piksel düzeyinde aynı olduğunu iddia etmiyor.

Ödünleşimler

Ekipler yine de fazladan GPU kaynağı ile daha kısa gecikme arasında seçim yapmak durumunda. Karşılaştırma testi eşzamanlı istek verimini, video başına maliyeti ya da toplam sahip olma maliyetini ölçmüyor; bu metrikler kendi SLO'larına göre değerlendirilmeli. Dynamo-Triton 26.07 NGC'den indirilebilir.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.