
DeepSeek מציגה מצב Vision: הצ׳אט קורא תמונות, API עדיין אין
DeepSeek הוסיפה לאפליקציית הצ׳אט שלה מצב Vision, ובכך הצ׳אטבוט הצרכני שלה קורא תמונות לראשונה ולא רק טקסט. ההשקה היא בטא מוגבלת למשתמשים נבחרים, ומאחוריה אין עדיין API ציבורי לראייה ממוחשבת.
DeepSeek הוסיפה לאפליקציית הצ׳אט שלה מצב Vision (זיהוי תמונות) — הפעם הראשונה שבה הצ׳אטבוט הצרכני של החברה יכול לעבוד עם תמונות ולא רק עם טקסט. הפיצ׳ר הופיע ב-Hacker News ב-17 ביוני 2026, וב-18 ביוני החל לפעול כבטא מוגבלת למשתמשים נבחרים באתר ובאפליקציה של DeepSeek.
מה בדיוק שוחרר
Vision הוא מצב הפעלה שלישי לצד המצבים הקיימים Fast (Instant) ו-Expert: המשתמש עובר אליו בדיוק כמו בין מצבי הטקסט, מצרף תמונה ושואל שאלות. לפי צ׳ן שיאוקאנג (Chen Xiaokang), ראש הצוות הרב-מודלי של DeepSeek ואחד המחברים של סדרת המודלים DeepSeek-VL, הפונקציה נפתחה תחילה לחלק מהמשתמשים לבדיקות בטא. ההשקה מגיעה אחרי השקת דגלי ה-V4: V4-Pro ו-V4-Flash עם משקולות פתוחות ברישיון MIT, שיצאו באפריל 2026.
חשיבה בפרימיטיבים חזותיים
הרעיון הטכני שמאחורי המצב נקרא "חשיבה בפרימיטיבים חזותיים". במקום לתאר את התמונה בטקסט רגיל, המודל מסמן נקודות ומסגרות ישירות על התמונה כחלק משרשרת החשיבה שלו — בדומה לאדם שמעביר אצבע על שורה בעת ספירה. הטענה של המפתחים היא שטקסט בלבד מעורפל מדי כדי לזהות אובייקט מסוים בסצנה עמוסה, ושערפול זה הוא בדיוק מה שדוחף מודלים לבלבול ולהזיות.
Vision בנוי על DeepSeek-V4-Flash. כדי שעיבוד התמונות לא יגזול יותר מדי כוח חישוב, הצוות דוחס את הזיכרון: כל ארבעה טוקנים חזותיים מתקפלים לרשומה אחת, וכך מתקבלת עלות נמוכה בהרבה לתמונה לעומת מודלים רב-מודליים טיפוסיים. בפועל המשמעות היא תשובות מדויקות יותר לתרשימים מורכבים, לצילומי מסך של ממשקים ולתמונות עשירות בפרטים, משום שהמודל יכול להצביע על החלק בתמונה שממנו נגזרת המסקנה שלו.
מה המשמעות
לפי המפתחים, המודל משתווה ל-GPT-5.4, ל-Claude Sonnet 4.6 ול-Gemini 3 Flash במשימות ספירת אובייקטים וחשיבה מרחבית — מדובר במערך מבחנים צר שנתפר לעבודה הזו, ולא בטענה ליכולת כללית. משקולות המודל טרם פורסמו. לא פחות חשוב למפתחים: אין עדיין מזהה מודל ציבורי ל-API של חזון. הפיצ׳ר חי בתוך מוצר הצ׳אט ולא כנקודת קצה למפתחים, ולכן מי שמתכנן לקרוא לראייה של DeepSeek מתוך קוד יצטרך להמתין.
DeepSeek מהמרת על יעילות ולא על גודל גולמי — פחות טוקנים לתמונה פירושם הסקה זולה יותר למשתמש הקצה — בעוד התחרות במודלים רב-מודליים נשארת עזה, עם מהדורות חדשות של OpenAI, Google ומפתחים סיניים כמעט מדי שבוע.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.