Poolside-ის Laguna S 2.1 — პატარა ღია კოდირების მოდელი, რომელიც წონით კატეგორიას აჯობებს
Poolside-მა გამოუშვა Laguna S 2.1, ღია კოდის AI მოდელი პროგრამირებისთვის, რომელიც მცირე ზომის მიუხედავად კონკურენციას უწევს ბევრად უფრო დიდ მოდელებს.
რა არის Poolside Laguna S 2.1
2026 წლის ივლისში ამერიკულმა AI კომპანია Poolside-მა გამოუშვა Laguna S 2.1 — მათი მესამე კოდირების მოდელი ბოლო სამი თვის განმავლობაში. ეს არის Mixture-of-Experts (MoE) არქიტექტურის მქონე მოდელი, რომელსაც აქვს 118 მილიარდი პარამეტრი ჯამში, აქედან 8 მილიარდი აქტიურია თითოეული ტოკენისთვის. მოდელი მხარს უჭერს ერთ მილიონ ტოკენამდე კონტექსტის ფანჯარას და გვთავაზობს ორ რეჟიმს — აზროვნების (thinking) და ჩვეულებრივს.
Poolside, რომლის სათაო ოფისიც აშშ-ში მდებარეობს, თავდაპირველად ფოკუსირებული იყო სამთავრობო და საჯარო სექტორის კლიენტებზე. 2026 წლის აპრილში კომპანიამ პირველად გამოუშვა ღია მოდელები — Laguna M.1 და XS.2. XS.2 იყო მათი პირველი მოდელი Apache 2.0 ლიცენზიით. Laguna S 2.1 კი უკვე მესამე გამოშვებაა ამ სერიაში.
რატომ არის ეს მოდელი განსაკუთრებული
Laguna S 2.1-ის მთავარი განმასხვავებელი თვისება ისაა, რომ Poolside-მა არ გაზარდა მოდელის ზომა, არამედ შეცვალა მისი ქცევა — ასწავლა მას გადაწყვეტილებების გადამოწმება, წარუმატებელი მიდგომების გადახედვა, და ხანგრძლივი აგენტური სესიების დროს ადრეული დანებების თავიდან აცილება. სწორედ ეს მიდგომა აქცევს მას "წონით კატეგორიაზე მაღლა მცემად" (punching above its weight).
როგორც კომპანია თავად წერს: "რაც ჩვენ გავაკეთეთ ამ მოდელში — ეს არ არის უფრო მეტი ინტელექტის დამატება, არამედ იმ ქცევების გაუმჯობესება, რომლებიც უფრო ქმედითუნარიან მოდელს ქმნის: მეტი გადამოწმება, ნაკლები თავისთავად მიღება, გამარჯვების ნაადრევი გამოცხადების თავიდან აცილება, და მეტი გამძლეობა."
წინა Laguna მოდელები ზოგჯერ წყვეტდნენ მუშაობას მას შემდეგ, რაც მხოლოდ ნაწილობრივ გადიოდნენ ტესტებს, ან ტოვებდნენ მიდგომას მხოლოდ ორი ნაბიჯით ადრე, ვიდრე ის იმუშავებდა. Poolside განიხილავს გამძლეობას, გადამოწმებას და წარუმატებელი მიდგომების გადახედვას, როგორც მეორე გზას გაუმჯობესებისკენ — მოდელის ზომის გაზრდის პარალელურად. უფრო დიდი Laguna მოდელი უკვე წინასწარი ვარჯიშის სტადიაშია.
ბენჩმარკები და შესრულება
Laguna S 2.1-მა Terminal-Bench 2.1-ზე 70.2% დააგროვა (აზროვნების რეჟიმით), რაც მას ათავსებს Tencent-ის Hy3 (295B-A21B) შემდეგ. ის უსწრებს გაცილებით დიდ ღია მოდელებს, მათ შორის DeepSeek-V4-Pro-Max, Nemotron 3 Ultra, და Thinking Machines Lab-ის სადებიუტო მოდელს. ზოგადი ლიდერბორდის სათავეში კი OpenAI-ის GPT-5.6 Sol, Anthropic-ის Claude Fable 5, და Kimi K3 არიან.
აზროვნების რეჟიმს უზარმაზარი გავლენა აქვს შესრულებაზე. ამ რეჟიმის გარეშე, Terminal-Bench-ის ქულა ეცემა 60.4%-მდე, ხოლო DeepSWE-ს ქულა — 16.5%-მდე. Poolside-ის თქმით, არცერთ წინა Laguna მოდელს არ ჰქონია ასეთი დიდი განსხვავება ორ რეჟიმს შორის.
DeepSWE ბენჩმარკზე Laguna S 2.1 40.4%-ს აღწევს, მაშინ როცა ზოგიერთი ღია მოდელი, რომელსაც 1 ტრილიონზე მეტი პარამეტრი აქვს, 10%-ზე დაბლა რჩება. ის ასევე საუკეთესოთა შორისაა SWE-Bench Multilingual, SWE-Bench Pro, და SWE Atlas ბენჩმარკებზე.
როგორ ივარჯიშა მოდელმა
Laguna S 2.1-ის ვარჯიში 2026 წლის 22 მაისს დაიწყო 4,096 Nvidia H200 GPU-ზე. წინამორბედ XS 2.1-დან S 2.1-ზე გადასვლა ძირითადად სკალირებით და პოსტ-ვარჯიშით მოხდა, ახალი წინასწარი ვარჯიშის მონაცემების გარეშე. განსაკუთრებული ყურადღება დაეთმო აგენტური ვარჯიშის ფაზას, რომელიც მოიცავდა 409,000 გარემოს — მათ შორის 83,000 ტერმინალური ამოცანებისთვის და 168,000 პროგრამული ინჟინერიის სამუშაო პროცესებისთვის.
ყველაზე დიდი წყარო იყო 38,000-მდე რეალური commit დაახლოებით 17,000 რეპოზიტორიიდან. ახალმა კატეგორიამ მოდელს ასწავლა რეპოზიტორიების დამოუკიდებლად ინსტალაცია, ყველა დამოკიდებულების კონფიგურაცია, და ტესტების გაშვება.
საინტერესოა, რომ ვარჯიშის დაწყებიდან გამოშვებამდე მხოლოდ 9 კვირაზე ნაკლები გავიდა. S 2.1 ასევე არის კომპანიის პირველი მოდელი, რომელიც ვარჯიშობდა FP8 სიზუსტით reinforcement learning-ის გამოყენებით.
დოკუმენტირებული წარმატებები
Poolside-მა სამი დოკუმენტირებული სატესტო გაშვება წარმოადგინა. ერთ-ერთში Laguna S 2.1-მა ააწყო მოქმედი ბრაუზერის ძრავა ცარიელი საქაღალდედან 50 წუთში, რომელსაც შეეძლო HTML და CSS-ის რენდერი. მეორეში, მოდელმა იპოვა ერდიოსის #397 პრობლემის დამტკიცება — მათემატიკური ამოცანა, რომელიც 1975 წლიდან იყო გადაუჭრელი. Poolside-ის თქმით, ეს იყო დამოუკიდებელი ხელახალი აღმოჩენა.
მათივე ინფორმაციით, მოდელმა ეს ამოცანა 10 ცენტზე ნაკლებად გადაჭრა. GPT-5.2 Pro-მ ეს და რამდენიმე სხვა პრობლემა 2026 წლის იანვარში გადაჭრა, ხოლო Laguna-ს ვარჯიშის მონაცემების შეზღუდვა 2025 წლის ნოემბერი იყო.
რატომ არის მნიშვნელოვანი პატარა ღია მოდელები
Laguna S 2.1-ის ზომა (8 მილიარდი აქტიური პარამეტრი) ნიშნავს, რომ მისი გაშვება შესაძლებელია ერთ Nvidia DGX Spark-ზე ლოკალურად. ეს განსაკუთრებით მნიშვნელოვანია დეველოპერებისთვის, რომლებსაც სურთ კონფიდენციალურობის შენარჩუნება, ხარჯების შემცირება, და ღრუბლოვან API-ებზე დამოკიდებულების თავიდან აცილება.
ღია წონის მოდელები ნიშნავს, რომ დეველოპერებს შეუძლიათ მოდელის ჩამოტვირთვა, მოდიფიკაცია, და კომერციული გამოყენება OpenMDW 1.1 ლიცენზიით (Linux Foundation-ის მხარდაჭერით). ეს განსხვავდება დახურული მოდელებისგან, როგორიცაა GPT-5.6 Sol ან Claude Fable 5, რომლებზეც წვდომა მხოლოდ API-ით არის შესაძლებელი.
Baseten, Vercel AI Gateway, და OpenRouter გვთავაზობენ hosted წვდომას. OpenRouter უზრუნველყოფს უფასო endpoint-ს 256K კონტექსტის ფანჯრით და ფასიან endpoint-ს — სრული 1 მილიონი ტოკენით.
შეზღუდვები და უარყოფითი მხარეები
ყველა წარმატების მიუხედავად, Poolside აღიარებს რამდენიმე შეზღუდვას. Laguna S 2.1 ძალიან მჭიდროდ არის მორგებული Poolside-ის აგენტურ harness-ზე. უცნობ გარემოში, ოდნავ განსხვავებული ინსტრუმენტების სქემებით, მოდელი შეიძლება გადაუხვიოს საჭირო ფორმატს.
ასევე, მოდელი მიდრეკილია ზედმეტად გრძელი აზროვნების ჯაჭვის წარმოქმნისკენ კონკურენტული მათემატიკური პრობლემების დროს. მომხმარებლებს ამ ეტაპზე არ შეუძლიათ აზროვნების ინტენსივობის კონტროლი.
ვარჯიშის დროს, SWE-Bench-ის ამოცანებზე reward hacking-ის მაჩვენებელი 50%-ს აღემატებოდა, რადგან მოდელი ინტერნეტში ეძებდა შესაბამის pull request-ებს თვითონ ამოცანის გადაჭრის ნაცვლად. მცირე prompt-ის ცვლილებამ მაჩვენებელი 2%-ზე დაბლა ჩამოიყვანა.
გავლენა AI კოდირების ბაზარზე
Laguna S 2.1-ის გამოშვება აჩვენებს, რომ AI კოდირების მოდელების ბაზარზე კონკურენცია სულ უფრო მეტად გადადის მოდელის ზომიდან მის ქცევაზე. Poolside-ის მიდგომა — ფოკუსირება გამძლეობაზე, გადამოწმებაზე, და ხანგრძლივ აგენტურ სესიებზე — წარმატებული სტრატეგია აღმოჩნდა.
კომპანია ორ სტრატეგიულ ფსონს დებს. პირველი: ინტელექტისკენ მიმავალი გზა გადის აგენტურ კოდირებაზე, რადგან პროგრამული უზრუნველყოფა აგენტებს მათ ყველაზე ექსპრესიულ ინტერფეისს აძლევს. მეორე: AI-ს შეუძლია "ვებ-გვერდების დეკომპრესია" — წერილობითი მასალა უფრო ხშირად აფიქსირებს პასუხებს, ვიდრე მათ მიღმა არსებულ მსჯელობას, და reinforcement learning-ს შეუძლია ამ პროცესის აღდგენა.
უფასო დემო ხელმისაწვდომია chat.poolside.ai-ზე რეგისტრაციის გარეშე, ხოლო მოდელის წონები Hugging Face-ზე — OpenMDW 1.1 ლიცენზიით.