
Qwen-Image-2.1: نموذج مدمج بـ7 مليارات معامل يوحّد إنشاء الصور وتحريرها
أطلقت Qwen نموذجها مفتوح المصدر Qwen-Image-2.1، وهو نموذج صور يوحّد التوليد من النص والتحرير في شبكة واحدة، بمكوّن توليد بصري يضم 7 مليارات معامل ودعم أصلي للشفافية.
بنية مدمجة بـ7 مليارات معامل
أصدرت Qwen نموذج Qwen-Image-2.1 بمصدر مفتوح، وهو نموذج صور تقول الشركة إنه يوازن بين جودة التوليد وكفاءة الاستدلال والتكلفة. يوحّد الإصدار توليد الصور من النص وتحرير الصور في نموذج واحد، يضم مكوّنه البصري 7 مليارات معامل ويدعم الشفافية بشكل أصلي.
يتكوّن المكوّن البصري من 32 طبقة Single-Stream DiT. ورغم الحجم المدمج، تقول Qwen إن جودة التوليد تبقى مرتفعة، وإن كفاءة الاستدلال كانت محوراً عند التحرير بعدة صور مدخلة. يأتي ذلك من بنية انتباه متعددة الدقة: النص، بما يشمل بادئة النظام وتعليمات التحرير، يستخدم قناعاً سببياً على مستوى الرمز، بينما يستخدم توليد الصورة قناعاً على مستوى الكتل. وتعرّف إعادة استخدام ذاكرة KV الصور المدخلة وتعليمات التحرير كسياق ثابت يُحسب ويُخزَّن في الخطوة الأولى، ما يسرّع الاستدلال ويقلل استهلاك الذاكرة.
الشفافية داخل نموذج واحد
كان Qwen-Image-Layered، الذي طُرح في ديسمبر 2025، نموذجاً منفصلاً لتوليد الصور الشفافة. ويدمج Qwen-Image-2.1 هذه القدرة في النموذج الموحّد، ويترك للأمر النصي تحديد ما إذا كان الناتج صورة عادية أو صورة بقناة شفافية. ولأن التوليد والتحرير موحّدان، يمكن تحرير الصور الشفافة مباشرة، مثل تغيير تعبير شخصية مع الإبقاء على الخلفية الشفافة. وتمتدّ القدرة إلى الصور الفوتوغرافية: يستطيع النموذج استخراج العنصر المطلوب من صورة RGB كطبقة RGBA، ما يسهّل إعادة استخدام العناصر في التصميم والتركيب.
تحرير بما يصل إلى 10 صور مرجعية
تعدد Qwen أربعة تحسينات في التحرير: مراجع متعددة، وتحرير محلي، والحفاظ على الدقة، وتغطية المهام. يقبل النموذج حتى 10 صور مرجعية ويمكنه دمج شخصيات وعناصر منفصلة في تكوين واحد: ستة بورتريهات في صورة جماعية، وملابس كاملة من خمسة مراجع، وترتيب غرفة من عشر صور أثاث.
يُحدَّد التحرير المحلي بدوائر أو علامات مرسومة أو قناع منفصل؛ وللحفاظ على الصورة المدخلة كما هي يمكن تمرير الأصل والقناع كمدخلين منفصلين. ويركز العمل على الدقة في هوية البورتريه واتساق المنتج، إذ تبقى ملامح الوجه أكثر ثباتاً بين التحريرات، مع الحفاظ على نص المنتج وملمسه وشكله. وتشمل المهام بانوراما تُولَّد من صورة سيلفي، ورسوماً معلوماتية تُوسَّع من صورة عارض، ولوحات قصصية تُبنى من مرجع شخصية بثلاث زوايا.
يحسّن الإصدار أيضاً الطباعة وتصيير البورتريهات، إذ يراعي توليد النص أنماط الخطوط والتخطيط. يتوفر Qwen-Image-2.1 على GitHub وHugging Face وModelScope، ويقدّمه الفريق أداة عملية للتصميم وإنتاج المحتوى والتجارة الإلكترونية والسرد البصري.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.