العودة
Liquid AI تطلق نموذج DSpark لتسريع النماذج البصرية اللغوية
SiTech AI Team2 წთ. საკითხავი

Liquid AI تطلق نموذج DSpark لتسريع النماذج البصرية اللغوية

أطلقت Liquid AI نموذج مسودة تجريبياً باسم DSpark لنموذجها البصري اللغوي LFM2.5-VL-3B: يسرّع فك التشفير التخميني حتى 3.13 مرة على الجهاز و2.66 مرة على H100، من دون تغيير جودة المخرجات.

أعلنت Liquid AI في 24 سبتمبر عن إطلاق نموذج مسودة تجريبي باسم DSpark لنموذجها البصري اللغوي LFM2.5-VL-3B. يضيف النموذج مساراً لفك التشفير التخميني يوفر زيادة بسيطة في الذاكرة مقابل تسريع أكبر، من دون تغيير جودة المخرجات.

ماذا يقدم النموذج

وفق قياسات Liquid AI، يتسارع فك التشفير حتى 3.13 مرة على الجهاز و2.66 مرة على H100، وينخفض زمن الاستجابة حتى 2.62 و2.27 مرة. يضيف نموذج المسودة نحو 280 مليون معامل، أي 8.9% فوق النموذج الأساسي بحجم 3B، ويتوفر دعم llama.cpp وMLX-VLM وSGLang من اليوم الأول.

كيف يعمل فك التشفير التخميني في النماذج البصرية

يستخدم نموذج المسودة البصري المعمارية نفسها التي تستخدمها نماذج LFM2.5-DSpark النصية من Liquid AI: يقرأ الحالات المخفية للنموذج الهدف عند طبقات محددة ويقترح بناءً عليها كتلة من k رمزاً مرشحاً. تُسقَط أجزاء الصورة والرموز النصية في تمثيل مشترك، لذلك يعمل النموذج على متجهات بالبعد نفسه بصرف النظر عن نوع المدخلات.

مخطط معمارية نموذج DSpark

جرى التدريب وفق وصفة DSpark على بيانات ضبط دقيق بصرية لغوية: بعد مقارنة إصدارات بثلاث وأربع وخمس طبقات، وقع الاختيار على نموذج مسودة مبسّط بأربع طبقات يعتمد على آلية الانتباه فقط، بحجم كتلة 9. ويضم النموذج في المجمل نحو 279.5 مليون معامل.

التسريع على الجهاز وعلى H100

أُجريت القياسات بحجم كتلة 8 على ست مهام بصرية وفق معيار MMSpec، من الأسئلة البصرية العامة ووصف الصور إلى أسئلة المخططات والمحادثة متعددة الأدوار. ومع MLX على M5 Max تسارع فك التشفير بين 2.30 و3.13 مرة، وانخفض زمن الاستجابة بين 1.56 و2.62 مرة. ومع llama.cpp على M3 Ultra تحسّن فك التشفير بين 1.57 و2.14 مرة، والزمن الكلي بين 1.30 و1.77 مرة. وعلى H100 يتسارع فك التشفير حتى 2.66 مرة، وينخفض الزمن الكلي بين 1.64 و2.27 مرة.

تسريع فك التشفير على الجهاز

حيث يتوقف أثر التخمين

يسرّع فك التشفير التخميني مرحلة فك التشفير فقط، لا ترميز الصورة ولا التعبئة المسبقة. تمر الصورة أولاً عبر مُرمّز بصري، ثم يعالج العمود الفقري اللغوي مئات الرموز البصرية إلى جانب الطلب النصي، وفي أجهزة الأطراف تستهلك هذه المرحلة حصة أكبر من الزمن الكلي. وعندما تستهلك هذه المراحل جزءاً كبيراً من الوقت أصلاً، فإن حتى التسريع الكبير في فك التشفير لا يعطي سوى مكسب متواضع. وتفسر Liquid AI ذلك بقانون أمدال.

يتوفر نموذج المسودة على Hugging Face بصيغتي Safetensors وGGUF، ويحتاج إلى إصدارات من llama.cpp وMLX-VLM وSGLang تدعم DSpark. وفك التشفير التخميني دقيق: يتحقق النموذج الهدف من كل رمز مقترح، لذا يطابق الناتج في الوضع الجشع مخرجات النموذج الهدف وحده.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.