العودة
DeepSeek تطلق وضع Vision: الدردشة تقرأ الصور، ولا واجهة API بعد
SiTech AI Team2 წთ. საკითხავი

DeepSeek تطلق وضع Vision: الدردشة تقرأ الصور، ولا واجهة API بعد

أضافت DeepSeek وضع Vision (التعرّف على الصور) إلى تطبيق الدردشة، ليتمكّن روبوت المحادثة الاستهلاكي لديها من العمل بالصور وليس بالنص وحده للمرة الأولى. ويجري الطرح كنسخة تجريبية محدودة، ولا توجد خلفها واجهة برمجة تطبيقات عامة للرؤية حتى الآن.

أضافت DeepSeek وضع Vision (التعرّف على الصور) إلى تطبيق الدردشة، وهي المرة الأولى التي يستطيع فيها روبوت المحادثة الاستهلاكي لدى الشركة العمل بالصور وليس بالنص وحده. ظهرت الميزة على Hacker News في 17 يونيو 2026، وانطلقت في 18 يونيو كنسخة تجريبية محدودة لمستخدمين مختارين على موقع DeepSeek وتطبيق الهاتف.

ما الذي صدر فعلاً

وضع Vision هو نمط تشغيل ثالث إلى جانب الخيارين الحاليين Fast (Instant) وExpert: ينتقل المستخدم إليه كما ينتقل بين أنماط النص، ثم يرفق صورة ويطرح أسئلته. وبحسب تشن شياوكانغ (Chen Xiaokang)، رئيس الفريق متعدد الوسائط في DeepSeek وأحد مؤلفي سلسلة نماذج DeepSeek-VL، أُتيحت الوظيفة أولاً لجزء من المستخدمين لاختبارها التجريبي. ويأتي الإطلاق بعد إطلاق الجيل الرائد V4: نموذجا V4-Pro وV4-Flash بأوزان مفتوحة تحت رخصة MIT، وصدرا في أبريل 2026.

التفكير بالعناصر البصرية الأولية

تُسمّى الفكرة التقنية خلف الوضع "التفكير بالعناصر البصرية الأولية". فبدلاً من وصف الصورة بنص عادي، يضع النموذج نقاطاً وإطارات مباشرة على الصورة كجزء من سلسلة تفكيره — أشبه بإنسان يمرّر إصبعه على سطر أثناء العدّ. وتقول الشركة المطوّرة إن النص وحده غامض أكثر من اللازم لتحديد جسم معيّن في مشهد مزدحم، وإن هذا الغموض تحديداً هو ما يدفع النماذج إلى الارتباك والهلوسة.

بُني Vision على أساس DeepSeek-V4-Flash. وللحيلولة دون أن تستهلك معالجة الصور قدراً كبيراً من الحوسبة، يضغط الفريق الذاكرة: كل أربعة رموز بصرية تُدمج في مدخل واحد، ما يمنح كلفة أقل بوضوح لكل صورة مقارنة بالنماذج متعددة الوسائط المعتادة. عملياً يعني ذلك إجابات أدق للمخططات المعقّدة ولقطات شاشة الواجهات والصور الغنية بالتفاصيل، لأن النموذج يستطيع الإشارة إلى الجزء الذي يستند إليه استنتاجه في الصورة.

ماذا يعني ذلك

بحسب المطوّرين، يضاهي النموذج GPT-5.4 وClaude Sonnet 4.6 وGemini 3 Flash في مهام عدّ الأجسام والتفكير المكاني — وهي مجموعة اختبارات ضيّقة مصمّمة لهذا العمل تحديداً، وليست ادعاءً بقدرة عامة. ولم تُنشر أوزان النموذج بعد. والأمر المهم نفسه للمطوّرين: لا يوجد بعد معرّف نموذج عام لواجهة برمجة تطبيقات الرؤية. فالميزة تعيش داخل منتج الدردشة لا كنقطة نهاية للمطوّرين، لذا سيتعيّن على من يخطّط لاستدعاء رؤية DeepSeek من الشيفرة أن ينتظر.

تراهن DeepSeek على الكفاءة لا على الحجم الخام — فرموز أقل لكل صورة تعني استدلالاً أرخص للمستخدم النهائي — في وقت تبقى المنافسة في النماذج متعددة الوسائط محتدمة، مع إصدارات جديدة من OpenAI وGoogle ومطوّرين صينيين تصل شبه كل أسبوع.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.