
DeepSeek Vision-ı təqdim etdi: çat şəkilləri oxuyur, API hələ yoxdur
DeepSeek çat tətbiqinə Vision rejimini əlavə edib; şirkətin istehlakçı çatbotu ilk dəfə yalnız mətnlə deyil, şəkillərlə də işləyə bilir. Yayım məhdud beta kimi davam edir və arxasında hələ açıq şəkil API-si yoxdur.
DeepSeek çat tətbiqinə Vision (şəkil tanıma) rejimini əlavə edib — şirkətin istehlakçı çatbotu ilk dəfə yalnız mətnlə deyil, şəkillərlə də işləyə bilir. Funksiya 17 iyun 2026-cı ildə Hacker News-də görünüb və 18 iyunda DeepSeek-in veb saytı və mobil tətbiqində seçilmiş istifadəçilər üçün məhdud beta kimi işə salınıb.
Nə buraxıldı
Vision mövcud Fast (Instant) və Expert seçimlərinin yanında üçüncü iş rejimidir: istifadəçi mətn rejimləri arasında keçdiyi kimi bu rejimə keçir, şəkil əlavə edir və suallar verir. DeepSeek-in multimodal komandasının rəhbəri və DeepSeek-VL model seriyasının müəlliflərindən biri olan Chen Xiaokang-a görə funksiya əvvəlcə istifadəçilərin bir hissəsinə beta test üçün açılıb. Buraxılış aprel 2026-da MIT lisenziyası altında açıq çəkilərlə çıxan V4 flaqman buraxılışından (V4-Pro və V4-Flash) sonra gəlir.
Vizual primitivlərlə düşünmə
Rejimin arxasındakı texniki ideya "vizual primitivlərlə düşünmə" adlanır. Model şəkli adi mətnlə təsvir etmək əvəzinə düşünmə zəncirinin bir hissəsi olaraq nöqtələri və çərçivələri birbaşa şəklin üzərində işarələyir — sayarkən barmağını sətir üzrə aparan insan kimi. Tərtibatçıların arqumenti budur: tək mətn sıx səhnədə konkret obyekti dəqiq göstərmək üçün həddən artıq qeyri-müəyyəndir və modelləri çaşqınlığa və hallüsinasiyaya sürükləyən məhz bu qeyri-müəyyənlikdir.
Vision DeepSeek-V4-Flash üzərində qurulub. Şəkil emalının çox hesablama aparmaması üçün komanda yaddaşı sıxır: hər dörd vizual token bir qeydə yığılır və bu, şəkil üzrə xərci tipik multimodal modellərə nisbətən nəzərəçarpan dərəcədə aşağı salır. Praktikada bu, mürəkkəb diaqramlar, interfeys ekran görüntüləri və detallarla zəngin fotolar üçün daha dəqiq cavablar deməkdir, çünki model nəticəsinin dayandığı şəkil hissəsini göstərə bilir.
Bunun mənası
Tərtibatçılara görə model obyekt sayma və məkan düşüncəsi tapşırıqlarında GPT-5.4, Claude Sonnet 4.6 və Gemini 3 Flash ilə bərabərdir — bu, ümumi qabiliyyət iddiası deyil, konkret bu işə uyğunlaşdırılmış dar meyar dəstidir. Modelin çəkiləri hələ yayımlanmayıb. Tərtibatçılar üçün ən az onun qədər vacib olan məqam budur: açıq vision API model ID-si hələ yoxdur. Funksiya tərtibatçı son nöqtəsi kimi deyil, çat məhsulunun içində yaşayır, yəni DeepSeek-in görmə qabiliyyətini koddan çağırmağı planlaşdıranlar gözləməli olacaq.
DeepSeek xam ölçüyə deyil, səmərəliliyə güvənir — şəkil üzrə daha az token son istifadəçi üçün daha ucuz inference deməkdir — multimodal modellərdə rəqabət sərt qalır və OpenAI, Google və Çin tərtibatçılarından yeni buraxılışlar demək olar ki, hər həftə gəlir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.