
DeepSeek-ը ներկայացրել է Vision-ը. չաթը կարդում է պատկերներ, API դեռ չկա
DeepSeek-ը իր չաթ-հավելվածին ավելացրել է Vision ռեժիմը, և ընկերության սպառողական չաթբոթն առաջին անգամ աշխատում է պատկերների հետ, ոչ միայն տեքստի։ Տարածումն ընթանում է որպես սահմանափակ բետա, որի հետևում դեռ հրապարակային vision API չկա։
DeepSeek-ը իր չաթ-հավելվածին ավելացրել է Vision (պատկերների ճանաչման) ռեժիմը՝ ընկերության սպառողական չաթբոթն առաջին անգամ կարող է աշխատել ոչ միայն տեքստի, այլև պատկերների հետ։ Ֆունկցիան Hacker News-ում հայտնվել է 2026 թվականի հունիսի 17-ին, իսկ հունիսի 18-ին մեկնարկել է որպես սահմանափակ բետա ընտրված օգտատերերի համար DeepSeek-ի կայքում և բջջային հավելվածում։
Ինչ է թողարկվել
Vision-ը երրորդ աշխատանքային ռեժիմն է գործող Fast (Instant) և Expert տարբերակների կողքին. օգտատերը անցնում է դրան այնպես, ինչպես տեքստային ռեժիմների միջև, կցում պատկեր և հարցեր տալիս։ Ըստ DeepSeek-ի բազմամոդալ թիմի ղեկավար Չեն Սյաոկանի (Chen Xiaokang), ով DeepSeek-VL մոդելների շարքի հեղինակներից է, ֆունկցիան սկզբում տրամադրվել է օգտատերերի մի մասին՝ բետա-թեստավորման համար։ Թողարկումը հաջորդում է V4 դրոշակակիր լանսինգին. V4-Pro և V4-Flash բաց կշիռներով, MIT լիցենզիայով, թողարկվել են 2026 թվականի ապրիլին։
Մտածողություն վիզուալ պրիմիտիվներով
Ռեժիմի տեխնիկական գաղափարը կոչվում է «մտածողություն վիզուալ պրիմիտիվներով»։ Պատկերը սովորական տեքստով նկարագրելու փոխարեն մոդելը մտածողության շղթայի մասում ուղղակիորեն պատկերի վրա նշում է կետեր և շրջանակներ՝ նման այն մարդուն, ով հաշվելիս մատը տանում է տողով։ Մշակողների փաստարկն այն է, որ միայն տեքստը չափազանց անորոշ է խիտ տեսարանում կոնկրետ օբյեկտը նշելու համար, և հենց այդ անորոշությունն է մոդելներին հրում շփոթության ու հալյուցինացիաների։
Vision-ը կառուցված է DeepSeek-V4-Flash-ի վրա։ Որպեսզի պատկերների մշակումը չսպառի չափազանց շատ հաշվողական ռեսուրս, թիմը սեղմում է հիշողությունը. յուրաքանչյուր չորս վիզուալ տոկեն ծալվում է մեկ գրառման մեջ, ինչը պատկերի համար տալիս է նկատելիորեն ցածր արժեք, քան տիպիկ բազմամոդալ մոդելները։ Գործնականում դա նշանակում է ավելի ճշգրիտ պատասխաններ բարդ դիագրամների, ինտերֆեյսի սքրինշոթների և մանրամասնությամբ հարուստ լուսանկարների համար, քանի որ մոդելը կարող է մատնանշել պատկերի այն հատվածը, որի վրա հենվում է իր եզրակացությունը։
Ինչ է սա նշանակում
Ըստ մշակողների՝ մոդելը հավասարվում է GPT-5.4-ին, Claude Sonnet 4.6-ին և Gemini 3 Flash-ին օբյեկտների հաշվման և տարածական մտածողության առաջադրանքներում. սա նեղ չափանիշների հավաքածու է՝ հարմարեցված կոնկրետ այս աշխատանքին, և ոչ թե ընդհանուր հնարավորությունների պնդում։ Մոդելի կշիռները դեռ հրապարակված չեն։ Մշակողների համար նույնքան կարևոր է, որ հրապարակային vision API մոդելի ID դեռ չկա. ֆունկցիան ապրում է չաթ-ապրանքի ներսում, այլ ոչ որպես մշակողական վերջնակետ, ուստի նրանք, ովքեր ծրագրում են կոդից կանչել DeepSeek-ի տեսողությունը, ստիպված կլինեն սպասել։
DeepSeek-ը խաղադրույք է կատարում արդյունավետության, այլ ոչ թե չմշակված չափի վրա. պատկերի համար ավելի քիչ տոկեն նշանակում է ավելի էժան ինֆերենս վերջնական օգտատիրոջ համար, մինչ բազմամոդալ մոդելների մրցակցությունը մնում է լարված, և OpenAI-ի, Google-ի ու չինացի մշակողների նոր թողարկումները գալիս են գրեթե ամեն շաբաթ։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։