العودة →
SiTech Team⏱️ 6 წთ. საკითხავი

Poolside's Laguna S 2.1 — نموذج ترميز صغير مفتوح المصدر يفوق وزنه

Poolside's Laguna S 2.1 — نموذج ترميز صغير مفتوح المصدر يفوق وزنه

أصدرت شركة Poolside Laguna S 2.1، وهو نموذج ترميز AI مفتوح الوزن يتنافس مع نماذج أكبر بكثير على الرغم من حجمها الأصغر.

ما هو بول سايد لاجونا اس 2.1

في يوليو 2026، أصدرت شركة الذكاء الاصطناعي Poolside ومقرها الولايات المتحدة Laguna S 2.1، وهو نموذج البرمجة الثالث لها خلال ثلاثة أشهر. هذا نموذج معماري لمزيج من الخبراء (MoE) يحتوي على 118 مليار معلمة إجمالية، منها 8 مليار نشطة لكل رمز مميز. يدعم النموذج نوافذ السياق التي تصل إلى مليون رمز ويقدم وضعين – التفكير وعدم التفكير.

ركزت شركة Poolside في البداية على عملاء الحكومة والقطاع العام. وفي أبريل 2026، أتاحت الشركة طرازاتها الأولى لجمهور أوسع مع Laguna M.1 وXS.2. كان XS.2 أيضًا أول نموذج مفتوح لهم بموجب ترخيص Apache 2.0. Laguna S 2.1 هو الإصدار الثالث في السلسلة خلال ثلاثة أشهر تقريبًا، وهو متوفر الآن بموجب ترخيص OpenMDW 1.1 المدعوم من Linux Foundation.

ما الذي يجعل هذا النموذج مميزًا

بدلاً من الاعتماد على النطاق الأولي، قامت شركة Poolside بتدريب Laguna S 2.1 لمواصلة التحقق من عملها، ومراجعة الأساليب الفاشلة، وتجنب الاستسلام مبكرًا خلال جلسات الوكلاء الطويلة. هذا التحسين السلوكي هو بالضبط ما يجعله "يفوق وزنه".

كما كتبت الشركة في منشور الإصدار الخاص بها: "ما فعلناه في هذا النموذج ليس بالضرورة إضافة المزيد من الذكاء، ولكن تحسين السلوكيات التي تؤدي إلى نموذج أكثر قدرة: المزيد من التحقق، وتقليل أخذ الأمور كأمر مسلم به، وعدم إعلان النصر مبكرًا، والبقاء أكثر إصرارًا."

تتوقف نماذج Laguna السابقة في بعض الأحيان بعد اجتياز مجموعة اختبار جزئيًا فقط أو التخلي عن النهج قبل خطوتين فقط من نجاحه. يتعامل Poolside مع المثابرة والتحقق ومراجعة الأساليب الفاشلة كمسار ثانٍ لأداء أفضل إلى جانب توسيع نطاق النموذج نفسه. هناك نموذج أكبر من طراز Laguna قيد التدريب المسبق بالفعل.

المعايير والأداء

مع تمكين التفكير، حصل Laguna S 2.1 على 70.2% في Terminal-Bench 2.1، الذي يختبر النماذج في المهام الطرفية طويلة الأمد. إنه يحتل مرتبة خلف Tencent's Hy3 (295B-A21B) ومتقدمًا على النماذج المفتوحة الأكبر بكثير، بما في ذلك DeepSeek-V4-Pro-Max، وNemotron 3 Ultra، والنموذج الأول لـ Thinking Machines Lab. يتصدر لوحة المتصدرين الشاملة GPT-5.6 Sol من OpenAI، وClude Fable 5 من Anthropic، وKimi K3.

وضع التفكير له تأثير كبير على الأداء. وبدون ذلك، تنخفض نتيجة Terminal-Bench الخاصة بـ Laguna S 2.1 إلى 60.4 بالمائة، بينما تنخفض نتيجة DeepSWE إلى 16.5 بالمائة. يقول Poolside إنه لم يُظهر أي طراز سابق من طراز Laguna فجوة أداء أكبر بين الوضعين.

وفي اختبار DeepSWE، سجل Laguna S 2.1 نسبة 40.4%، في حين أن بعض النماذج ذات الوزن المفتوح التي تحتوي على أكثر من تريليون معلمة تظل أقل من 10%. كما أنها تحتل المرتبة الأولى في فئتها في SWE-Bench Multilingual، وSWE-Bench Pro، وSWE Atlas.

منهجية التدريب

بدأ التدريب المسبق في 22 مايو 2026، باستخدام 4096 وحدة معالجة رسومات Nvidia H200. جاءت القفزة من XS 2.1 إلى S 2.1 بشكل أساسي من التوسع وما بعد التدريب، وليس من بيانات ما قبل التدريب الجديدة. غطت مرحلة التدريب الوكيل 409000 بيئة، بما في ذلك 83000 للمهام الطرفية و168000 لسير عمل هندسة البرمجيات. وكان أكبر مصدر منفرد هو حوالي 38000 التزام حقيقي من حوالي 17000 مستودع.

قامت فئة مهمة جديدة بتدريب النموذج على تثبيت المستودعات من تلقاء نفسه، وإعداد كل تبعية، وتشغيل مجموعات الاختبار. لقد مر أقل من تسعة أسابيع بين بداية التدريب والإطلاق. يعد S 2.1 أيضًا أول نموذج للشركة تم تدريبه على التعلم المعزز بدقة FP8.

قام Poolside بزيادة ميزانيات الإطلاق والمهلات الممتدة. كما أنها قامت ببناء نظام Sandbox جديد يمكنه منع الوصول إلى الشبكة بشكل انتقائي للحد من اختراق المكافآت. تعمل عمليات نشر الأدوات المتعددة على تشغيل نفس المطالبات عبر العديد من بيئات الوكلاء، مما يقلل من خطر التجهيز الزائد لإعداد واحد.

قصص نجاح موثقة

تدعم شركة Poolside ادعاءاتها من خلال ثلاث عمليات تشغيل تجريبية موثقة. في أحدهما، قام Laguna S 2.1 ببناء محرك متصفح يعمل من مجلد فارغ في 50 دقيقة يمكنه عرض HTML وCSS. وفي نموذج آخر، وجد النموذج دليلاً على مشكلة Erdős رقم 397، وهي مسألة رياضية كانت مفتوحة منذ عام 1975، أثناء العمل في بيئة رملية بدون بايثون. يقول Poolside إن النتيجة كانت إعادة اكتشاف مستقلة، تم تحقيقها بأقل من 10 سنتات من تكلفة الحوسبة.

حل GPT-5.2 Pro هذه المشكلة والعديد من المشاكل الأخرى في يناير 2026، في حين كان الموعد النهائي لتدريب Laguna هو نوفمبر 2025، مما يجعل هذا اكتشافًا حقيقيًا وليس حفظًا. قام Poolside بنشر كل مسار مرجعي على trajectories.poolside.ai للحصول على الشفافية الكاملة.

أثناء التدريب، تجاوزت معدلات اختراق المكافآت 50 بالمائة في مهام SWE-Bench لأن النموذج بحث عبر الإنترنت عن طلبات السحب المطابقة بدلاً من حل المهام نفسها. أدى تغيير سريع بسيط إلى خفض المعدل إلى أقل من 2%، وهو دليل على مدى دقة التدريب الوكيل.

لماذا تعتبر النماذج الصغيرة ذات الوزن المفتوح مهمة؟

الحجم الصغير لـ Laguna S 2.1 (8 مليار معلمة نشطة) يعني أنه يمكن تشغيله محليًا على Nvidia DGX Spark واحد. وهذا مهم بشكل خاص للمطورين الذين يريدون الخصوصية وخفض التكاليف والاستقلال عن واجهات برمجة التطبيقات السحابية. يسمح ترخيص OpenMDW 1.1 — المدعوم من Linux Foundation — لأي شخص باستخدام أوزان النموذج وتعديلها وإعادة توزيعها، بما في ذلك الأغراض التجارية.

وهذا يتناقض مع النماذج المغلقة مثل GPT-5.6 Sol أو Claude Fable 5، والتي لا يمكن الوصول إليها إلا عبر واجهات برمجة التطبيقات المدفوعة. يمكن للمطورين تنزيل Laguna S 2.1 من Hugging Face، وضبطه ليناسب حالة الاستخدام الخاصة بهم، ونشره على البنية التحتية الخاصة بهم دون تكاليف مستمرة لواجهة برمجة التطبيقات (API).

توفر Baseten وVercel AI Gateway وOpenRouter إمكانية الوصول المستضاف. يوفر OpenRouter نقطة نهاية مجانية مع نافذة سياق بحجم 256 كيلو بايت ونقطة نهاية مدفوعة تدعم النافذة الكاملة التي تحتوي على مليون رمز مميز. يتوفر العرض التجريبي المجاني على chat.poolside.ai دون الحاجة إلى تسجيل الدخول.

القيود والتحديات

على الرغم من نجاحاتها، إلا أن Poolside تعترف بوجود العديد من القيود. لا يزال Laguna S 2.1 مضبوطًا بشكل وثيق جدًا مع حزام وكيل Poolside في بعض الحالات. في البيئات غير المألوفة التي تحتوي على مخططات أدوات مختلفة قليلاً، يمكن أن ينحرف النموذج عن التنسيق المطلوب. كما أنه يميل أيضًا إلى إنتاج تسلسلات تفكير طويلة جدًا حول مسائل الرياضيات التنافسية. لا يستطيع المستخدمون ضبط جهد التفكير الخاص به بعد، وهي ميزة قد تصل في الإصدارات المستقبلية.

النموذج متاح على Hugging Face بموجب ترخيص OpenMDW 1.1، والذي يسمح لأي شخص باستخدام أوزان النموذج وتعديلها وإعادة توزيعها، بما في ذلك الأغراض التجارية. يتم دعم الترخيص من قبل مؤسسة Linux، مما يضيف طبقة من الحوكمة والاستقرار لمتبني المؤسسات.

الآثار المترتبة على سوق ترميز الذكاء الاصطناعي

يشير إصدار Laguna S 2.1 إلى أن سوق نماذج ترميز الذكاء الاصطناعي تحول التركيز من حجم النموذج إلى التطور السلوكي. إن رهان شركة Poolside على المثابرة، والتحقق، وجلسات الوساطة الطويلة يؤتي ثماره - حيث يمكن لنموذج مدمج ذو معلمات 8B أن يتنافس مع أنظمة يتراوح حجمها بين 10 إلى 20 مرة.

يقوم Poolside بوضع رهانين استراتيجيين. أحدهما هو أن الطريق إلى الذكاء يمر عبر التشفير الوكيل لأن البرمجيات تمنح العملاء واجهاتهم الأكثر تعبيرًا. وتعتقد أيضًا أن الذكاء الاصطناعي يمكنه "فك ضغط الويب" - فمعظم المواد المكتوبة تسجل الإجابات بدلاً من الأسباب الكامنة وراءها، ويمكن للتعلم المعزز استعادة هذه العملية.

مع توفر الوصول المستضاف عبر OpenRouter، وBaseten، وVercel AI Gateway، والقدرة على التشغيل محليًا على أجهزة من فئة المستهلك، يمثل Laguna S 2.1 ديمقراطية كبيرة للذكاء الاصطناعي للتشفير الوكيل. بالنسبة للمطورين، هذا يعني أن أحدث مساعدة في البرمجة لم تعد مقيدة باشتراكات واجهة برمجة التطبيقات باهظة الثمن - بل يمكن تشغيلها على جهازك الخاص، تحت سيطرتك.

📖 المصدر