חזרה
Qwen-Image-2.1: מודל קומפקטי של 7B המאחד יצירה ועריכה של תמונות
SiTech Team2 წთ. საკითხავი

Qwen-Image-2.1: מודל קומפקטי של 7B המאחד יצירה ועריכה של תמונות

Qwen פרסמה בקוד פתוח את Qwen-Image-2.1, מודל תמונות שמאחד יצירה מטקסט ועריכה ברשת אחת, עם 7B פרמטרים בלבד ברכיב היצירה החזותית, תמיכה מובנית בשקיפות ועריכה עם עד עשר תמונות התייחסות.

ארכיטקטורה קומפקטית של 7B

Qwen שחררה בקוד פתוח את Qwen-Image-2.1, מודל תמונות שלדברי הצוות מאזן בין איכות היצירה, יעילות ההסקה והעלות. הוא מאחד יצירת תמונות מטקסט ועריכת תמונות במודל אחד, שרכיב היצירה החזותית שלו כולל 7B פרמטרים ותומך באופן מובנה בתמונות שקופות.

הרכיב בנוי מ־32 שכבות Single-Stream DiT. לפי Qwen, הגודל הקומפקטי אינו פוגע באיכות היצירה, ויעילות ההסקה הייתה מוקד בעת עריכה עם כמה תמונות קלט. את השיפור מספקת ארכיטקטורת קשב ברזולוציה מעורבת: טקסט, כולל קידומת המערכת והוראות העריכה, משתמש במסכה סיבתית ברמת הטוקן, בעוד יצירת התמונה משתמשת במסכה ברמת המקטעים. שימוש חוזר במטמון KV הופך את תמונות הקלט והוראות העריכה להקשר סטטי שמחושב ונשמר במטמון בשלב הראשון, מה שמאיץ את ההסקה ומפחית את צריכת הזיכרון.

שקיפות בתוך מודל אחד

Qwen-Image-Layered, שהוצגה בדצמבר 2025, הייתה מודל ייעודי ליצירת תמונות שקופות. Qwen-Image-2.1 משלב את היכולת הזו במודל המאוחד ומאפשר לפרומפט לקבוע אם הפלט יהיה תמונה רגילה או כזו עם ערוץ שקיפות. מכיוון שהיצירה והעריכה מאוחדות, אפשר לערוך תמונות שקופות ישירות — למשל לשנות את הבעת הפנים של דמות תוך שמירה על רקע שקוף. אותו דבר חל גם על צילומים: מתמונת RGB המודל מחלץ את האובייקט המבוקש כשכבת RGBA, מה שמקל על שימוש חוזר באלמנטים בעבודות עיצוב והרכבה.

עריכה עם עד 10 תמונות התייחסות

Qwen מפרטת ארבעה תחומי שיפור בעריכה: כמה תמונות התייחסות, עריכה מקומית, שמירה על נאמנות וכיסוי משימות. המודל מקבל עד 10 תמונות התייחסות ומאחד דמויות ואובייקטים נפרדים להרכב אחד: שישה פורטרטים לתצלום קבוצתי, תלבושת מחמש תמונות התייחסות, וסידור חדר מעשר תמונות ריהוט.

עריכה מקומית מסומנת בעיגולים, בכתמי צבע או במסכה נפרדת; כדי לשמור על תמונת הקלט בשלמותה אפשר להעביר את המקור והמסכה כשני קלטים נפרדים. עבודת הנאמנות מתמקדת בזהות הפורטרט ובעקביות המוצר: תווי הפנים נשמרים יציבים בין עריכות, וטקסט, מרקמים וצורה של המוצר נשמרים גם הם. בין המשימות: פנורמות שנוצרות מסלפי, אינפוגרפיקות שמתרחבות מתצלום של דוגמן, וסטוריבורדים שנבנים מתמונת התייחסות של דמות משלוש זוויות.

הגרסה משפרת גם טיפוגרפיה ורינדור פורטרטים, כאשר יצירת הטקסט מתחשבת בסגנונות הגופן ובפריסה. Qwen-Image-2.1 זמין ב-GitHub, ב-Hugging Face וב-ModelScope, והצוות מציג אותו ככלי מעשי לעיצוב, ליצירת תוכן, למסחר מקוון ולסיפור חזותי.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.