العودة
GLM-5.2 محلياً: Unsloth تنشر نسخاً كمّية لنموذج Z.ai
SiTech AI Team3 წთ. საკითხავი

GLM-5.2 محلياً: Unsloth تنشر نسخاً كمّية لنموذج Z.ai

نشرت Unsloth نسخاً كمّية ديناميكية بصيغة GGUF لنموذج GLM-5.2 المفتوح من Z.ai، البالغ 744 مليار معامل وبسياق يبلغ مليون رمز، ما يتيح تشغيله على محطة عمل محلية أو جهاز Mac.

ما هو GLM-5.2

نشرت Unsloth نسخاً كمّية ديناميكية بصيغة GGUF من نموذج GLM-5.2، النموذج المفتوح الجديد من Z.ai، ما يتيح تشغيله على عتاد محلي بدلاً من موارد سحابية مستأجرة. يضم النموذج 744 مليار معامل، منها 40 ملياراً نشطة في أي لحظة، ونافذة سياق تبلغ مليون رمز. وتقول Unsloth إنه يحقق نتائج متقدمة في البرمجة الطويلة والاستدلال والمهام الوكيلية، ويعمل بمستوى Claude 4.8 Opus وGPT-5.5 وGemini 3.1 Pro في اختبارات كثيرة — وهي مقارنة تصدر عن الجهة التي نشرت النسخ الكمّية نفسها، لا عن تقييم مستقل.

وتذكر الشركة أن Z.ai منحتها إمكانية الوصول إلى الأوزان منذ اليوم الأول، وأن الملفات الكمّية نُشرت على Hugging Face باسم GLM-5.2-GGUF.

الضغط الكمّي: أصغر بنسبة 86% وأقل دقة بنحو الخُمس

الجزء الأهم هو ما يحدث للدقة عند تصغير النموذج. وفق قياسات Unsloth، تبلغ النسخة الديناميكية ببت واحد دقة top-1 نحو 76.2% مع حجم أصغر بنسبة 86% من النموذج الكامل البالغ 1.5 تيرابايت، أما نسخة البتينين فتبلغ نحو 82% من الدقة بحجم أصغر بنسبة 84%. وتوصف نسختا 4 و5 بتات (UD-Q4_K_XL وUD-Q5_K_XL) بأنهما شبه خاليتين من الفقدان.

وتحذّر Unsloth من قراءة رقم top-1 كدرجة قدرة. فـ76% لا تعني أن النموذج يجيب خطأً في ربع الحالات، بل إن الرمز المفضّل لدى النموذج يتغير في كلمات الحشو وكلمات التوقف — فقد تتحول "سأكتب الآن رواية" إلى "الرواية أدناه". ولتدعيم ذلك نشر الفريق قياسات تباين KL التي تُظهر مقدار انحراف توزيع مخرجات النموذج الكمّي عن الأساس.

متطلبات الذاكرة

السؤال العملي لمن يملك محطة عمل أو جهاز Mac هو مقدار الذاكرة التي تحتاجها كل نسخة كمّية، باحتساب ذاكرة الرسوميات وذاكرة النظام معاً. يسرد جدول Unsloth 223 غيغابايت للبت الواحد، و245 للبتين، و290–360 لثلاثة بتات، و372–475 لأربعة، و570 لخمسة، و810 لثمانية بتات. وتشغل النسخة الموصى بها UD-IQ2_M مساحة 239 غيغابايت على القرص، أي أنها تتسع في جهاز Mac بذاكرة موحّدة سعة 256 غيغابايت، ويمكن تشغيل النسخة نفسها على بطاقة رسوميات واحدة بسعة 24 غيغابايت مع 256 غيغابايت من الذاكرة العشوائية عند استخدام إخراج MoE.

التشغيل: llama.cpp وUnsloth Studio

تغطي الأدلة مسارين. مع llama.cpp يجري تنزيل النموذج عبر أداة hf بنمط UD-IQ2_M (أو UD-IQ1_S لنسخة البت الواحد)، ثم تشغيله بأمر llama-cli مع temperature 1.0 وtop-p 0.95 وmin-p 0.01؛ وتبلغ نافذة السياق القصوى 1,048,576 رمزاً. أما Unsloth Studio، وهو واجهة ويب مفتوحة المصدر، فينقل الحِمل تلقائياً إلى الذاكرة العشوائية ويتعرّف على الأنظمة متعددة البطاقات ويُثبَّت بأمر واحد.

يأتي GLM-5.2 بثلاثة أنماط تفكير: بلا تفكير، ومستويان للاستدلال هما high وmax، تُختار عبر معامل reasoning_effort أو تُعطَّل كلياً بضبط enable_thinking على false. وتوصي Unsloth بنمط max للمهام المعقدة.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.