
DeepSeek-მა Vision წარადგინა: ჩატი სურათებს კითხულობს, API ჯერ არ არის
DeepSeek-მა ჩატ-აპში Vision რეჟიმი დაამატა — კომპანიის სამომხმარებლო ჩატბოტი პირველად მუშაობს სურათებთან, არა მხოლოდ ტექსტთან. გამოშვება შეზღუდული ბეტაა და საჯარო vision API ჯერ არ აქვს.
DeepSeek-მა ჩატ-აპში Vision (სურათების ამოცნობის) რეჟიმი დაამატა — კომპანიის სამომხმარებლო ჩატბოტს პირველად შეუძლია მუშაობა სურათებთან და არა მხოლოდ ტექსტთან. ფუნქცია Hacker News-ზე 17 ივნისს, 2026 წელს გამოჩნდა, 18 ივნისს კი შეზღუდული ბეტას სახით ამოქმედდა DeepSeek-ის ვებსაიტსა და მობილურ აპში.
რა გამოვიდა
Vision მესამე სამუშაო რეჟიმია არსებული Fast (Instant) და Expert ვარიანტების გვერდით: მომხმარებელი მას ისე გადაერთვის, როგორც ტექსტურ რეჟიმებს შორის, მიმაგრებს სურათს და სვამს კითხვებს. DeepSeek-ის მულტიმოდალური გუნდის ხელმძღვანელის, ჩენ სიაოკანგის (Chen Xiaokang) თქმით — ის DeepSeek-VL მოდელების სერიის ავტორებიდან ერთ-ერთია — ფუნქცია თავდაპირველად მომხმარებლების ნაწილს გადაეცა ბეტა-ტესტირებისთვის. გამოშვება V4 ფლაგმანური ლანსირების შემდეგ მოდის: V4-Pro და V4-Flash ღია წონებით, MIT ლიცენზიით, 2026 წლის აპრილში გამოვიდა.
აზროვნება ვიზუალური პრიმიტივებით
რეჟიმის ტექნიკურ იდეას „აზროვნება ვიზუალური პრიმიტივებით“ ჰქვია. მოდელი სურათს ჩვეულებრივი ტექსტით არ აღწერს — ის აზროვნების ჯაჭვის ნაწილად პირდაპირ სურათზე ნიშნავს წერტილებსა და ჩარჩოებს, მსგავსად იმისა, როგორც ადამიანი თითს უსვამს ტექსტის ხაზს დათვლისას. დეველოპერების არგუმენტია, რომ მხოლოდ ტექსტი ზედმეტად ბუნდოვანია კონკრეტული ობიექტის დასაზუსტებლად გადატვირთულ სცენაზე და სწორედ ეს ბუნდოვნება იწვევს მოდელების დაბნევასა და ჰალუცინაციას.
Vision DeepSeek-V4-Flash-ის ბაზაზეა აწყობილი. იმისთვის, რომ სურათების დამუშავებამ ზედმეტი გამოთვლითი რესურსი არ შთანთქას, გუნდი მეხსიერებას აკუმპრესებს: ყოველი ოთხი ვიზუალური ტოკენი ერთ ჩანაწერად იკეცება, რაც სურათზე თვალსაჩინოდ ნაკლებ ღირებულებას იძლევა, ვიდრე ტიპური მულტიმოდალური მოდელები. პრაქტიკაში ეს ნიშნავს უფრო ზუსტ პასუხებს რთული დიაგრამებისთვის, ინტერფეისის სქრინშოტებისა და დეტალებით მდიდარი ფოტოებისთვის, ვინაიდან მოდელს შეუძლია მიუთითოს სურათის იმ ნაწილზე, რომელსაც მისი დასკვნა ეყრდნობა.
რას ნიშნავს ეს
დეველოპერების თქმით, მოდელი GPT-5.4-ს, Claude Sonnet 4.6-სა და Gemini 3 Flash-ს უტოლდება ობიექტების დათვლისა და სივრცითი მსჯელობის ამოცანებში — ეს ვიწრო ბენჩმარკების ნაკრებია, მორგებული კონკრეტულ ნაშრომზე და არა ზოგადი შესაძლებლობების მტკიცება. მოდელის წონები ჯერ არ გამოქვეყნებულა. დეველოპერებისთვის ისეთივე მნიშვნელოვანი დეტალია, რომ საჯარო vision API მოდელის ID ჯერ არ არსებობს: ფუნქცია ჩატ-პროდუქტის შიგნით ცხოვრობს და არა როგორც დეველოპერული ენდპოინტი, ამიტომ ყველას, ვინც კოდიდან DeepSeek-ის ხედვის გამოძახებას გეგმავს, ჯერ ლოდინი მოუწევს.
DeepSeek ეფექტიანობაზე დებს ფსონს და არა ნედლ ზომაზე — სურათზე ნაკლები ტოკენი ნიშნავს იაფ ინფერენსს საბოლოო მომხმარებლისთვის — მაშინ, როცა მულტიმოდალური მოდელების კონკურენცია ინტენსიური რჩება და OpenAI-ის, Google-ისა და ჩინური დეველოპერების ახალი გამოშვებები თითქმის ყოველკვირეულად ჩნდება.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.