Geri Dön
DeepSeek Vision'ı tanıttı: sohbet görsel okuyor, API henüz yok
SiTech AI Team2 წთ. საკითხავი

DeepSeek Vision'ı tanıttı: sohbet görsel okuyor, API henüz yok

DeepSeek sohbet uygulamasına Vision modunu ekledi; tüketici sohbet botu ilk kez görsellerle çalışabiliyor. Dağıtım sınırlı bir beta olarak ilerliyor ve arkasında henüz herkese açık bir görsel API bulunmuyor.

DeepSeek, sohbet uygulamasına Vision (görsel tanıma) modunu ekledi — şirketin tüketici sohbet botu ilk kez yalnızca metinle değil, görsellerle de çalışabiliyor. Özellik 17 Haziran 2026'da Hacker News'te ortaya çıktı ve 18 Haziran'da DeepSeek'in web sitesi ile mobil uygulamasında seçili kullanıcılara sınırlı beta olarak açıldı.

Ne yayınlandı

Vision, mevcut Fast (Instant) ve Expert seçeneklerinin yanındaki üçüncü çalışma modu: kullanıcı metin modları arasında geçiş yapar gibi bu moda geçiyor, bir görsel ekliyor ve sorularını soruyor. DeepSeek'in çok modlu ekibinin başı ve DeepSeek-VL model serisinin yazarlarından Chen Xiaokang'a göre işlev önce beta testi için kullanıcıların bir bölümüne açıldı. Sürüm, Nisan 2026'da MIT lisansıyla açık ağırlıklı olarak çıkan V4 amiral gemisi lansmanının (V4-Pro ve V4-Flash) ardından geliyor.

Görsel primitiflerle düşünme

Modun arkasındaki teknik fikir "görsel primitiflerle düşünme" olarak adlandırılıyor. Model, görseli düz metinle tarif etmek yerine akıl yürütme zincirinin parçası olarak doğrudan görselin üzerine noktalar ve kutular işaretliyor — tıpkı sayarken parmağını bir satırda gezdiren bir insan gibi. Geliştiricilerin argümanı şu: yalnızca metin, kalabalık bir sahnede belirli bir nesneyi tam olarak işaret etmek için fazla belirsizdir ve modelleri karışıklığa ve halüsinasyona iten tam da bu belirsizliktir.

Vision, DeepSeek-V4-Flash üzerine kurulu. Görsel işlemenin çok fazla hesaplama tüketmemesi için ekip belleği sıkıştırıyor: her dört görsel token tek bir kayda indirgeniyor, bu da görsel başına maliyeti tipik çok modlu modellere göre belirgin biçimde düşürüyor. Pratikte bu, karmaşık diyagramlar, arayüz ekran görüntüleri ve ayrıntı yoğun fotoğraflar için daha doğru yanıtlar anlamına geliyor; çünkü model, sonucunun dayandığı görsel bölümünü işaret edebiliyor.

Bu ne anlama geliyor

Geliştiricilere göre model, nesne sayma ve uzamsal akıl yürütme görevlerinde GPT-5.4, Claude Sonnet 4.6 ve Gemini 3 Flash ile başa baş. Bu, genel bir yetenek iddiası değil, bu çalışmaya özel dar bir kıyaslama seti. Model ağırlıkları henüz yayımlanmadı. Geliştiriciler için en az onun kadar önemli olan nokta şu: herkese açık bir görsel API model kimliği henüz yok. Özellik bir geliştirici uç noktası olarak değil, sohbet ürününün içinde yaşıyor; yani DeepSeek'in görüsünü koddan çağırmayı planlayanlar beklemek zorunda.

DeepSeek ham büyüklüğe değil verimliliğe oynuyor — görsel başına daha az token, son kullanıcı için daha ucuz çıkarım demek — çok modlu modellerde rekabet sert kalırken OpenAI, Google ve Çinli geliştiricilerden yeni sürümler neredeyse her hafta geliyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.