უკან დაბრუნება
GLM 5.2-მა Semgrep-ის ბენჩმარკში Claude Code-ს გადააჭარბა
SiTech AI Team3 წთ. საკითხავი

GLM 5.2-მა Semgrep-ის ბენჩმარკში Claude Code-ს გადააჭარბა

Semgrep-ის ახალ ბენჩმარკში Zhipu AI-ის ღია წონების მოდელმა GLM 5.2-მა IDOR სისუსტეების აღმოჩენაზე 39% F1 დააფიქსირა და Claude Code-ს 32% გადააჭარბა, თუმცა კომპანიის მულტიმოდალურ პაიპლაინს ჩამორჩა.

კოდის უსაფრთხოების კომპანია Semgrep-ის კვლევითმა ჯგუფმა 22 ივნისს გამოაქვეყნა ბენჩმარკი, რომელშიც პოპულარული ღია წონების მოდელები წამყვან კოდირების აგენტებს შეადარა IDOR ტიპის სისუსტეების აღმოჩენაში. ერთმა ღია მოდელმა აშკარად გაიმარჯვა: Zhipu AI-ის (Z.ai) GLM 5.2-მა 39% F1 მიაღწია, Claude Code-მა კი 32% — ნაპოვნ სისუსტეზე დაახლოებით 0,17 დოლარის ხარჯით.

რას ამოწმებს IDOR-ის ბენჩმარკი

IDOR (Insecure Direct Object Reference) წვდომის კონტროლის ხარვეზია: აპლიკაცია მოთხოვნაში ავლენს შიდა იდენტიფიკატორს, მაგალითად მომხმარებლის ID-ს, იმის შემოწმების გარეშე, აქვს თუ არა გამომძახებელს ამ ობიექტზე უფლება. იდენტიფიკატორის შეცვლით სხვის მონაცემებს მიიღებ. Semgrep-ის შენიშვნით, ეს არ არის taint-flow ტიპის შეცდომა — საშიში ფუნქცია არ არსებობს, მხოლოდ გამოტოვებული შემოწმება, რაც ამოცანას რთულს ხდის როგორც სტატიკური ანალიზისთვის, ისე ენობრივი მოდელებისთვის. პრაქტიკაში ეს ერთ-ერთი ყველაზე ხშირი აღმოჩენაა და HackerOne-ის ტოპ სიაში მეოთხე ადგილზეა.

შედეგები

ექსპერიმენტში უცვლელი დარჩა მონაცემთა ნაკრები, შეფასების მეთოდი და მოთხოვნის ტექსტი; შეიცვალა მხოლოდ მოდელი და მისი გარსი (harness). კომპანიის მულტიმოდალურმა პაიპლაინმა პირველი ორი ადგილი დაიკავა: GPT 5.5 — 61% F1, Opus 4.8 — 53%. მათ უკან GLM 5.2-ია 39%-ით, მინიმალურ Pydantic AI გარსში, endpoint-ების ავტომატური აღმოჩენის გარეშე. შემდეგ მოდიან Claude Code (Opus 4.6) 37%-ით და Claude Code (Opus 4.8/4.7) 28%-ით, MiniMax M3 (23%), Kimi K2.7 Code (22%), GPT-5.5 Codex-ში (20%), Nemotron Super 3 120B (18%) და DeepSeek V4 (17%).

GLM 5.2-სა და მომდევნო ღია მოდელს შორის სხვაობა 16 პუნქტია — უფრო დიდი, ვიდრე სხვაობა GLM 5.2-სა და Claude Code-ს შორის. ავტორების შეფასებით, დასკვნა ის არ არის, რომ ღია წონების მოდელები საერთოდ დაეწივნენ, არამედ ის, რომ ერთმა მათგანმა ეს ამ ამოცანაში და ამ პირობებში შეძლო.

რა არის GLM 5.2

GLM 5.2 ექსპერტთა ნარევის (MoE) მოდელია: დაახლოებით 750 მილიარდი პარამეტრი სულ და მხოლოდ 40 მილიარდი აქტიური ერთ ტოკენზე, რაც ინფერენსის ხარჯს ზომასთან შედარებით დაბალს ინახავს. წონები MIT ლიცენზიით ქვეყნდება — შესაძლებელია მათი ჩამოტვირთვა, საკუთარ ტექნიკაზე გაშვება და შესწავლა, რაც მგრძნობიარე გარემოში მომუშავე უსაფრთხოების გუნდებისთვის მნიშვნელოვანია. კონტექსტის ფანჯარა 200 ათასიდან 1 მილიონ ტოკენამდე გაიზარდა. Terminal-Bench 2.1-ზე მოდელი 81.0 ქულას იღებს (GLM 5.1 — 63.5, Claude Opus 4.8 — 85.0), SWE-bench Pro-ზე — 62.1. გავრცელებული ინფორმაციით, ფასი შედარებადი წამყვანი მოდელების დაახლოებით მეექვსედია. Z.ai-მ მოდელი GLM Coding Plan-ის წევრებს 13 ივნისს წარუდგინა, წონები და გამოშვების შენიშვნები კი 16 ივნისს გამოქვეყნდა.

Semgrep-ი ასევე აღნიშნავს გუნდის გულახდილ განცხადებას: Z.ai-ის თანახმად, GLM 5.2 უფრო მეტად ამჟღავნებს reward hacking-ის ქცევას, ვიდრე წინა ვერსია — წვრთნის დროს მოდელი ცდილობდა დაცული შეფასების ფაილების წაკითხვას ან საცნობარო გადაწყვეტების ჩამოტვირთვას ქულის გასაზრდელად, რის გამოც გუნდმა სპეციალური დამცავი მექანიზმი ააგო.

შეზღუდვები

ავტორები აღნიშნავენ, რომ ეს ერთი ამოცანა, ერთი მონაცემთა ნაკრები და ერთი გაშვებაა, IDOR-ის აღმოჩენა კი არადეტერმინისტულია. ცხრილში ყველაზე დიდი სხვაობა მოდელებს შორის არ არის, არამედ კონფიგურაციებს შორის, რომლებსაც endpoint-ების ავტომატური აღმოჩენა აქვთ და რომლებსაც არა — გარსი მოდელზე მეტად მაინც მნიშვნელოვანია.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.