Назад
DeepSeek представила Vision: чат читає зображення, API поки немає
SiTech AI Team2 წთ. საკითხავი

DeepSeek представила Vision: чат читає зображення, API поки немає

DeepSeek додала до свого чату режим Vision, тож її споживчий чатбот уперше працює із зображеннями, а не лише з текстом. Розгортання має вигляд обмеженої бети, а публічного vision API під нею поки немає.

DeepSeek додала до свого чату режим Vision (розпізнавання зображень) — уперше її споживчий чатбот може працювати із зображеннями, а не лише з текстом. Функція з'явилася на Hacker News 17 червня 2026 року, а 18 червня вийшла як обмежена бета для вибраних користувачів на сайті та в мобільному застосунку DeepSeek.

Що саме випустили

Vision — це третій робочий режим поряд із наявними Fast (Instant) та Expert: користувач перемикається на нього так само, як між текстовими режимами, прикріплює зображення й ставить запитання. За словами Чень Сяокана (Chen Xiaokang), керівника мультимодальної команди DeepSeek і одного з авторів серії моделей DeepSeek-VL, спершу функцію відкрили частині користувачів для бета-тестування. Реліз іде за флагманським запуском V4 — V4-Pro і V4-Flash з відкритими вагами під ліцензією MIT вийшли у квітні 2026 року.

Мислення візуальними примітивами

Технічна ідея режиму називається «мислення візуальними примітивами». Замість описувати зображення звичайним текстом, модель позначає точки й рамки безпосередньо на картинці як частину ланцюжка міркувань — приблизно так, як людина веде пальцем по рядку, рахуючи. Розробники пояснюють: самого лише тексту замало, щоб точно вказати конкретний об'єкт у насиченій сцені, і саме ця неточність штовхає моделі до плутанини та галюцинацій.

Vision побудований на DeepSeek-V4-Flash. Щоб обробка зображень не з'їдала занадто багато обчислень, команда стискає пам'ять: кожні чотири візуальні токени згортаються в один запис, що дає помітно нижчу вартість на зображення, ніж у типових мультимодальних моделей. На практиці це означає точніші відповіді для складних діаграм, скриншотів інтерфейсу та насичених деталями фото, адже модель може вказати на ту частину зображення, на якій ґрунтується її висновок.

Що це означає

За словами розробників, модель зрівнюється з GPT-5.4, Claude Sonnet 4.6 і Gemini 3 Flash у задачах підрахунку об'єктів і просторового мислення — це вузький набір бенчмарків, підібраний під конкретну роботу, а не заява про загальні можливості. Ваги моделі ще не опубліковані. Не менш важливо для розробників: публічного ID моделі vision API досі немає. Функція живе всередині чат-продукту, а не як endpoint для розробників, тож тим, хто планує викликати зір DeepSeek із коду, доведеться зачекати.

DeepSeek робить ставку на ефективність, а не на сирий розмір — менше токенів на зображення означає дешевший інференс для кінцевого користувача — тоді як конкуренція в мультимодальних моделях залишається жорсткою, а нові релізи від OpenAI, Google і китайських розробників з'являються майже щотижня.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.