العودة
Jeff: نماذج قرار بحجم 0.8B متوافقة مع Jev دُرّبت على وحدة رسومات محلية واحدة
SiTech AI Team2 წთ. საკითხავი

Jeff: نماذج قرار بحجم 0.8B متوافقة مع Jev دُرّبت على وحدة رسومات محلية واحدة

مشروع مفتوح المصدر يحوّل Qwen3.5 وGemma 4 إلى مصنّفات صغيرة من دون تدريب مسبق، تعيد احتمالًا معايرًا لكل خيار في تمريرة أمامية واحدة خلال نحو 22 مللي ثانية فقط لكل قرار.

ظهر على GitHub مشروع مفتوح المصدر باسم Jeff يحوّل نماذج Qwen3.5 وGemma 4 الصغيرة بحجم 0.8B و2B إلى مصنّفات تستخدم صيغة الطلب نفسها التي يستخدمها Jev. يصف المستخدم الحالة والخيارات بكلمات بسيطة، فيعيد النموذج احتمالًا معايرًا لكل خيار من تمريرة أمامية واحدة. لا يولّد النموذج نصًا، لذلك لا حاجة إلى تحليل الإجابة. يستغرق القرار نحو 22 مللي ثانية على NVIDIA RTX PRO 6000 و28 مللي ثانية على Apple M4 Max عبر MLX.

ما هو Jeff

يعني الوضع zero-shot أن الخيارات يمكن أن تكون أي شيء: طوابير الدعم، نوايا المستخدمين، تصنيفات الإشراف أو حركات اللعبة. لا يلزم أن تظهر هذه الفئات في بيانات التدريب، لأن المستخدم يصفها في الطلب. نُشرت ثلاثة نماذج على Hugging Face: ‏Jeff-Qwen3.5-0.8B وJeff-Qwen3.5-2B وJeff-Gemma4-E2B. ويحمل الطلب الواحد ثلاثة أنواع من الأسئلة: اختيار من 255 خيارًا كحد أقصى، وإجابة نعم/لا تعود كاحتمال، ودرجة على مقياس موصوف.

نتائج الاختبارات

اختُبرت النماذج على 4599 سؤالًا من خمسة اختبارات عامة، وعلى المستوى الصعب من JevBench بشكل منفصل، وهو 105 عناصر. في المجموع الكلي يبلغ Jeff-Qwen3.5-2B نحو 83.1 وJeff-Gemma4-E2B نحو 81.6 وJeff-Qwen3.5-0.8B نحو 79.1، مقابل 83.0 في أرقام Jev المنشورة. في Financial PhraseBank ترتفع النماذج الصغيرة إلى 96.4 مقابل 77.0، أما في اختبارات الاستدلال فتتخلف: 64.0 في BBH مقابل 94.3. ويكتب المؤلفون أن النتيجة الكلية تأتي من مهام التصنيف، حيث لا تتخلف النماذج الصغيرة عن الكبيرة.

دقة Jeff في الاختبارات مقابل أرقام Jev المنشورة

التدريب على عتاد محلي

بُني المشروع على عتاد محلي: يتدرب نموذج 0.8B في نحو ساعتين على وحدة رسومات واحدة من طراز RTX PRO 6000 في محطة عمل، أما 2B ففي نحو ثلاث ساعات ونصف. كتب بيانات التدريب الاصطناعية نموذج مفتوح هو Qwen3.8-Flash-Next على جهازي DGX Spark، وأُجريت الاختبارات على MacBook. لم تُستخدم وحدات رسومات سحابية، ولم تدخل مخرجات أي نموذج مغلق في بيانات التدريب. Jeff مشروع مستقل وغير مرتبط بشركة TypeSafe المطوّرة لـ Jev. الكود برخصة MIT والأوزان برخصة Apache 2.0.

الألعاب والقيود

لاختبار قدرة zero-shot لعب Jeff ثلاث ألعاب، مع وصف كل دور بالكلمات: 6.55 قتيلًا في Doom، وهي نتيجة روبوت قواعد مكتوب يدويًا، و10.3 عبور في Frogger مقابل 1.0 للنموذج غير المدرّب، و57.0 من 98 نقطة في Pac-Man مقابل 25.8، مع اتخاذ الحركة في 29-49 مللي ثانية على M4 Max. ويعدد المؤلفون القيود: النماذج الصغيرة لا تستدل، وتعمل على النص الإنجليزي فقط، ودرجات الاختبارات لا تتوقع الأداء في اللعبة، والنموذج 2B يلعب أسوأ من 0.8B. والضبط القصير على أمثلة خاصة يغيّر الكثير: نسخة للتنقل الصوتي بنحو 11 ألف مثال رفعت الدقة من 31.7% إلى 95.8% في أقل من نصف ساعة على وحدة رسومات واحدة.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.