
Qwen-Image-2.1: компактна 7B-модель для генерації та редагування зображень
Qwen відкрила код Qwen-Image-2.1 — моделі, яка поєднує генерацію зображень із тексту й редагування в одній мережі, має 7B параметрів у компоненті візуальної генерації та нативно підтримує прозорість.
Компактна архітектура на 7B параметрів
Qwen опублікувала у відкритому доступі Qwen-Image-2.1 — модель зображень, яка, за словами команди, балансує між якістю генерації, ефективністю виведення та витратами. Вона об'єднує генерацію зображень із тексту й редагування в одній моделі; компонент візуальної генерації має 7B параметрів і нативно підтримує прозорі зображення.
Компонент складається з 32 шарів Single-Stream DiT. Qwen заявляє, що компактний розмір не позначається на якості генерації, а ефективність виведення була окремим пріоритетом для редагування з кількома вхідними зображеннями. Це забезпечує архітектура уваги зі змішаною гранулярністю: текст, включно із системним префіксом та інструкціями редагування, використовує причинну маску на рівні токенів, а генерація зображення — маску на рівні блоків. Повторне використання KV-кешу робить вхідні зображення й інструкції статичним контекстом, який обчислюється та кешується на першому кроці, що прискорює виведення й зменшує споживання пам'яті.
Прозорість в одній моделі
Qwen-Image-Layered, представлена у грудні 2025 року, була окремою моделлю для генерації прозорих зображень. Qwen-Image-2.1 вбудовує цю можливість у єдину модель і за промптом вирішує, чи повертати звичайне зображення, чи таке, що має канал прозорості. Оскільки генерація та редагування об'єднані, прозорі зображення можна редагувати напряму — наприклад, змінити вираз персонажа, зберігши прозорий фон. Те саме стосується фотографій: з RGB-зображення модель виділяє потрібний об'єкт як RGBA-шар, що спрощує повторне використання елементів у дизайні та композиції.
Редагування з до 10 референсних зображень
Qwen називає чотири напрями покращення редагування: кілька референсів, локальні правки, збереження вірності та широта задач. Модель приймає до 10 референсних зображень і поєднує окремих персонажів та об'єкти в одну композицію: шість портретів — у груповий знімок, костюм — із п'яти референсів, розстановку кімнати — з 10 зображень меблів.
Локальні правки задаються колами, намальованими позначками або окремою маскою; щоб зберегти вхідне зображення незмінним, оригінал і маску можна подати як два входи. Робота над вірністю стосується ідентичності портрета та узгодженості продукту: риси обличчя залишаються стабільними між правками, а текст, текстури й форма продукту зберігаються. Серед задач — панорами, згенеровані із селфі, інфографіка, розширена з фотографії моделі, та розкадровки, побудовані з референсу персонажа у трьох видах.
Реліз також покращує типографіку та рендеринг портретів: під час відтворення тексту враховуються стилі шрифтів і компонування. Qwen-Image-2.1 доступна на GitHub, Hugging Face і ModelScope, а команда подає її як практичний інструмент для дизайну, створення контенту, електронної комерції та візуальних історій.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.