Վերադառնալ
GLM-ը սեփական inference ենթակառուցվածքը կառուցել է AI գործակալով
SiTech AI Team2 წთ. საკითხავი

GLM-ը սեփական inference ենթակառուցվածքը կառուցել է AI գործակալով

Z.ai-ն նկարագրել է, թե ինչպես GLM-5.3-ի վրա հիմնված Infra Agent-ը կառուցել է GLM-5.3-Flash-ի inference ծառայությունը 100 հազարից ավելի չինական արագացուցիչների վրա՝ երկու շաբաթից պակաս ժամանակում։

Z.ai-ն սեպտեմբերի 17-ին հրապարակել է հետազոտական գրառում, որտեղ նկարագրվում է, թե ինչպես GLM-5.3-ի վրա հիմնված Infra Agent-ը կառուցել է այն inference ծառայությունը, որի վրա այսօր աշխատում է GLM-5.3-Flash-ը։ Գրառման վերնագիրն է «Դեպի ռեկուրսիվ ինքնակատարելագործում», սակայն ընկերությունը բացահայտ նշում է, որ նպատակին դեռ չի հասել՝ երևում են միայն նրա վաղ ձևերը։

100 հազար արագացուցիչ և երկու շաբաթ

GLM-5.3-Flash-ի ողջ արտադրական inference-ը աշխատում է կլաստերի վրա, որը միավորում է 100 հազարից ավելի չինական AI արագացուցիչ։ Ընկերության խոսքով՝ նման մասշտաբի կլաստեր նախկինում ոչ ոք չէր տեղակայել։ Թիմը բախվել է չիպերի սահմանափակ հիշողությանն ու թողունակությանը, նոր մոդելային ճարտարապետությանը, 1 միլիոն token-անոց կոնտեքստին և մուլտիմոդալ հարցումներին, ինչպես նաև չհասունացած էկոհամակարգին ու kernel-ների ոչ լրիվ աջակցությանը։

Աշխատանքի զգալի մասը կատարել է ոչ միայն ենթակառուցվածքի ինժեներների թիմը, այլ GLM-5.3-ով աշխատող Infra Agent-ը։ ReplaySSM-ի, W8A8 քվանտացման, INT8/FP8/BF16 խառը ճշգրտության քեշի քվանտացման, Layer Split-ի և Encode-Prefill-Decode ճարտարապետության շնորհիվ ծառայության աշխատանքը արագացել է մոտ երեք անգամ, իսկ token-ի արժեքը և սարքաշարի օգտագործման արդյունավետությունը մոտեցել են սովորական NVIDIA GPU-ների մակարդակին։ Սկզբնական հարմարեցումից մինչև արտադրության պատրաստ լինելը տևել է երկու շաբաթից պակաս։

«Խիտ հետադարձ կապ»

Գրառման հիմնական փաստարկն այն է, որ գործակալի ինժեներական արդյունավետությունն ավելի քիչ է կախված կոդ գրելու ունակությունից, քան ստացած հետադարձ կապի մանրամասնությունից։ Ծայրից ծայր մետրիկը գործակալին ասում է միայն, որ արդյունքը վատացել է, բայց չի բացատրում, թե ինչու։ Այդ պատճառով թիմը գործակալին հասանելի է դարձրել ճշգրտության թեստերը, microbenchmark-ները, կատարման հետքերը և runtime իրադարձությունները։ Նման «խիտ» հետադարձ կապն ունի երեք հատկություն՝ լոկալություն, արագ և էժան ստացվելիություն, ինչպես նաև վերահսկվող փորձերով օբյեկտիվ ստուգման հնարավորություն։

Կոնկրետ դեպքեր

KDA kernel-ի Context Parallelism ուղու վրա գործակալը գտել է թվային ճշգրտության սխալ. tl.dot-ը լռելյայն օգտագործում էր TF32 հաշվարկ նույնիսկ FP32 մուտքային տվյալների դեպքում, ինչի հետևանքով երկար կոնտեքստերում սխալը կուտակվում էր։ Ուղղումը՝ input_precision="tf32x3", իսկ փոփոխությունն ընդունվել է նաև Flash Linear Attention նախագծում (PR #1180)։

Խցանման դեպքում ընդունման չափանիշը թույլատրում էր առավելագույնը 5% արդյունավետության տարբերություն, սակայն գործակալը չափել է ավելի քան 20%։ Պատճառը DeepEP v1.2.1-ի intranode_dispatch և intranode_combine ֆունկցիաներն էին, որոնք չէին ազատում Python-ի GIL-ը և արգելակում էին Mooncake Transfer հոսքը։ GIL-ի ազատումից հետո տարբերությունը իջել է 1%-ից։

Սահմաններ և արդյունք

Մեկնարկից առաջ GLM-5.3-Flash-ը OpenCode-ում և OpenRouter-ում անանուն փորձարկվել է Ox-Alpha անվան տակ և մեկ շաբաթվա ընթացքում դարձել է ամենաշատ օգտագործվող մոդելը երկու պլատֆորմներում՝ վեց օրում մշակելով ավելի քան 62 տրիլիոն token։ Գրառումն ընդգծում է, որ նպատակների ընտրությունը, սահմանների սահմանումը և ռիսկի գնահատումը մնում են մարդու պատասխանատվությունը։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։