უკან დაბრუნება
GLM-მა საკუთარი inference ინფრასტრუქტურა AI აგენტის დახმარებით ააშენა
SiTech AI Team2 წთ. საკითხავი

GLM-მა საკუთარი inference ინფრასტრუქტურა AI აგენტის დახმარებით ააშენა

Z.ai-მ აღწერა, როგორ ააშენა GLM-5.3-ზე დაფუძნებულმა Infra Agent-მა 100 ათასზე მეტ ჩინურ აჩქარებელზე მომუშავე inference სერვისი — ორ კვირაში და სამჯერ უფრო მაღალი გამტარობით.

Z.ai-მ 17 სექტემბერს გამოაქვეყნა კვლევითი ბლოგი, რომელშიც აღწერილია, როგორ ააშენა GLM-5.3-ზე დაფუძნებულმა Infra Agent-მა ის inference სერვისი, რომელზეც დღეს GLM-5.3-Flash მუშაობს. სტატიას სათაურად აქვს „რეკურსიული თვითგაუმჯობესებისკენ" — კომპანია აღიარებს, რომ ეს მიზანი ჯერ მიღწეული არ არის, თუმცა მისი ადრეული ფორმები უკვე ჩანს.

100 ათასი აჩქარებელი და ორი კვირა

GLM-5.3-Flash-ის მთელი საწარმოო inference მუშაობს კლასტერზე, რომელიც 100 ათასზე მეტ ჩინურ AI აჩქარებელს აერთიანებს. კომპანიის თანახმად, ასეთი მასშტაბის კლასტერი აქამდე არავის განუთავსებია. ბარიერები იყო ჩიპის შეზღუდული მეხსიერება და გამტარუნარიანობა, ახალი არქიტექტურა, 1 მილიონ ტოკენიანი კონტექსტი და მულტიმოდალური მოთხოვნები; ეკოსისტემა მოუმწიფებელი იყო, kernel-ების მხარდაჭერა — არასრული.

სამუშაოს მნიშვნელოვანი ნაწილი ინფრასტრუქტურის ინჟინრებმა კი არა, GLM-5.3-ით მომუშავე Infra Agent-მა შეასრულა. ReplaySSM-ის, W8A8 კვანტიზაციის, INT8/FP8/BF16 შერეული სიზუსტის ქეშის კვანტიზაციის, Layer Split-ისა და Encode-Prefill-Decode არქიტექტურის შედეგად მომსახურების სიჩქარე დაახლოებით სამჯერ გაიზარდა, ტოკენის ღირებულება და ტექნიკის გამოყენების ეფექტურობა კი NVIDIA-ს GPU-ების დონეს მიუახლოვდა. საწყისი ადაპტაციიდან წარმოებისთვის მზადყოფნამდე პროცესმა ორ კვირაზე ნაკლები დრო დაიკავა.

„მკვრივი უკუკავშირი"

ბლოგის მთავარი არგუმენტია, რომ აგენტის ეფექტურობა კოდის წერის უნარზე ნაკლებად, იმაზეა დამოკიდებული, თუ რამდენად დეტალურ უკუკავშირს იღებს ის. მხოლოდ ჯამური მეტრიკა აგენტს ეუბნება, რომ შედეგი გაუარესდა, მაგრამ ვერ ხსნის, რატომ. ამიტომ გუნდმა აგენტს ხელმისაწვდომი გაუხადა სიზუსტის ტესტები, microbenchmark-ები, შესრულების კვალი და runtime მოვლენები. ასეთ „მკვრივ" უკუკავშირს სამი თვისება აქვს: ლოკალურობა, სწრაფი მიღება და ობიექტური გადამოწმების შესაძლებლობა.

კონკრეტული შემთხვევები

KDA kernel-ის Context Parallelism გზაზე აგენტმა რიცხვითი სიზუსტის ხარვეზი იპოვა: tl.dot ნაგულისხმევად TF32 ათვლას იყენებდა FP32 შემავალ მონაცემებზეც, რაც გრძელ კონტექსტზე შეცდომას აგროვებდა. გამოსწორება — input_precision="tf32x3"; ცვლილება Flash Linear Attention-ის რეპოზიტორიაშიც შევიდა (PR #1180).

KV Transfer-ის კონკურენტულობის ბარიერზე ტესტის სამიზნე 5%-იანი სხვაობა იყო, მაგრამ აგენტმა 20%-ზე მეტი დააფიქსირა. მიზეზი DeepEP v1.2.1-ის intranode_dispatch და intranode_combine ფუნქციები აღმოჩნდა, რომლებიც Python-ის GIL-ს არ ათავისუფლებდნენ და Mooncake Transfer-ის ნაკადს აბრკოლებდნენ; GIL-ის გათავისუფლების შემდეგ სხვაობა 1%-ზე დაბლა ჩამოვიდა.

საზღვრები და შედეგი

GLM-5.3-Flash გაშვებამდე OpenCode-სა და OpenRouter-ზე ანონიმური სახელით Ox-Alpha ტესტირდებოდა და გაშვებიდან ერთ კვირაში ორივე პლატფორმაზე ყველაზე ხშირად გამოყენებადი მოდელი გახდა — ექვს დღეში 62 ტრილიონ ტოკენზე მეტი დაამუშავა. ბლოგი ხაზს უსვამს, რომ მიზნების არჩევა, საზღვრების დაწესება და რისკის შეფასება ადამიანის პასუხისმგებლობად რჩება.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.