Վերադառնալ
NVIDIA-ն TensorRT-ի բազմասարք ինֆերենսը տեղափոխեց Dynamo-Triton
SiTech AI Team2 წთ. საკითხავი

NVIDIA-ն TensorRT-ի բազմասարք ինֆերենսը տեղափոխեց Dynamo-Triton

Dynamo-Triton 26.07-ը թույլ է տալիս Triton-ի մեկ մոդելի օրինակին տիրել մի քանի GPU-ի. Cosmos 3 Nano-ի վիդեո գեներացիան ութ GPU-ի վրա 156.6 վայրկյանից դարձել է 34.2։

NVIDIA-ն TensorRT-ի բազմասարք ինֆերենսը ինտեգրել է Dynamo-Triton-ում, ուստի հավելվածին այժմ պետք չէ ինքնուրույն համակարգել GPU-ների շարքերը։

Ինչ փոխվեց

TensorRT-ի բազմասարք ինֆերենսը մեկ ցանցին հնարավորություն է տալիս աշխատել մի քանի GPU-ների վրա՝ NCCL-ի վրա հիմնված բաշխված կոլեկտիվ գործողություններով և օպտիմիզացիաների պահպանմամբ։ Նախկինում Triton Inference Server անվանմամբ Dynamo-Triton-ը միացնում է այն 26.07 թողարկումում, և Triton-ի մեկ KIND_MODEL օրինակը կարող է տիրել մի քանի GPU-ի՝ ստեղծելով կատարման կոնտեքստներ, CUDA հոսքեր ու NCCL հաղորդակցիչներ և յուրաքանչյուր հարցման ժամանակ շարքերը մեկ gRPC կանչով միասին գործարկելով։

Diffusers-ի, Triton-ի և TensorRT-ի բազմասարք աշխատանքային հոսքը

Ինչպես է աշխատում սպասարկման ուղին

Ինտեգրումը ցուցադրվել է Cosmos 3 Nano վիդեո գեներացիայով. Diffusers-ը շարունակում է կառավարել միջավայրը, իսկ Dynamo-Triton-ը սպասարկում է 36 շերտով աղմուկազերծման տրանսֆորմերը։ Ulysses-ի կոնտեքստային զուգահեռականությամբ 44 160 վիդեո թոքեն բաշխվում է մինչև ութ GPU-ի վրա։

Բաշխված գրաֆը կոմպիլացվում է յուրաքանչյուր TensorRT պլանի մեջ մինչ տեղակայումը, ուստի Triton-ը ակտիվացնում է կոնտեքստային զուգահեռ պլան և չի վերափոխում մեկ սարքի շարժիչ։ Մեկ GPU-ի վրա տրանսֆորմերը կազմում է գեներացիայի ժամանակի 93.4%-ը, և քանի որ 35 աղմուկազերծման քայլերից յուրաքանչյուրը classifier-free guidance-ի համար երկու կանխատեսում է պահանջում, պրոքսին մեկ գեներացիայի համար 70 տրանսֆորմեր RPC է անում։

Հապաղման արդյունքները

Բոլոր չորս տարբերակները գործարկվել են նույն ութ GPU-ով համակարգում՝ 1280x720, 189 կադր 24 FPS-ով և հինգ չափված գեներացիա։ Ծայրից ծայր հապաղումը մեկ GPU-ի վրա 156.595 վայրկյանից իջել է երկուսի վրա՝ 87.999, չորսի վրա՝ 53.093 և ութի վրա՝ 34.183 վայրկյանի, այսինքն՝ 78.17%-ով։ Տրանսֆորմերի RPC-ի ժամանակը նվազել է 83.59%-ով, նրա մասնաբաժինը՝ 93.4%-ից 70.2%, իսկ ուղուց դուրս ժամանակը մնացել է 10.2–10.5 վայրկյանի սահմաններում։

Ծայրից ծայր հապաղման բաշխումը ըստ GPU կոնֆիգուրացիաների

Վավերացման ժամանակ յուրաքանչյուր արդյունք համեմատվել է նույն seed-ով արված մեկ սարքի արդյունքի հետ. CP2-ը և CP4-ը գրանցել են MAE 12.759 և PSNR 21.111 dB, CP8-ը՝ MAE 16.316 և PSNR 19.400 dB, բոլորը՝ սահմանված շեմերի ներսում։ NVIDIA-ն չի պնդում, որ արդյունքները պիքսելային մակարդակով նույնական են։

Փոխզիջումներ

Թիմերը դեռ պետք է ընտրեն՝ լրացուցիչ GPU ռեսուրսներ ավելի կարճ հապաղման դիմաց։ Բենչմարքը չի չափում միաժամանակյա հարցումների թողունակությունը, մեկ վիդեոյի արժեքը կամ ընդհանուր սեփականության արժեքը. այդ ցուցանիշները պետք է գնահատել սեփական SLO-ների համեմատ։ Dynamo-Triton 26.07-ը հասանելի է NGC-ում։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։