العودة →
SiTech Team⏱️ 3 წთ. საკითხავი

"Ali Baba Qwen-Image-3.0 — ذكاء اصطناعي ينشئ الرسوم البيانية والنص بحجم 10 بكسل في تمريرة واحدة"

"Ali Baba Qwen-Image-3.0 — ذكاء اصطناعي ينشئ الرسوم البيانية والنص بحجم 10 بكسل في تمريرة واحدة"

"أطلق فريق Qwen من Alibaba نموذج Qwen-Image-3.0 — نموذج ذكاء اصطناعي قادر على إنشاء الرسوم البيانية، وصيغ LaTeX، والنص المقروء بحجم 10 بكسل في تمريرة واحدة."

Alibaba Qwen-Image-3.0 — ذكاء اصطناعي يفهم حقاً النص، LaTeX، والرسوم البيانية

كشف فريق Qwen من Alibaba عن Qwen-Image-3.0، نموذج الجيل التالي لتوليد الصور بالذكاء الاصطناعي. هذا ليس مجرد ذكاء اصطناعي آخر يصنع صوراً جميلة — هدف Qwen-Image-3.0، كما يذكر مبتكروه، هو "حقيقي": أداة عملية مصممة للعمل الحقيقي. وإمكانياته مثيرة للإعجاب حقاً.

تخيل: أنت تعطي النموذج طلباً يصل طوله إلى 4500 رمز — تعليمات مطولة ومفصلة تصف ليس فقط ما يجب تصويره، ولكن بالضبط كيف يجب ترتيب العناصر. Qwen-Image-3.0 ينشئ تخطيطات معقدة وكثيفة في تمريرة واحدة: على سبيل المثال، 9 رسوم بيانية مختلفة مرتبة في شبكة 3×3، كل منها مع نصها وبياناتها وعناصرها البصرية — كلها تُنشأ في وقت واحد.

تمريرة واحدة، نتائج معقدة

معظم نماذج الذكاء الاصطناعي من الجيل السابق تطلبت جولات توليد متعددة أو معالجة لاحقة واسعة النطاق لإنشاء تركيبات معقدة. Qwen-Image-3.0 يغير ذلك. يمكنه إنشاء لوحة إنفوجرافيك كاملة — مع تصورات البيانات، وكتل النص، والبنية المنطقية — من طلب واحد. هذا ذو قيمة خاصة لمنشئي المحتوى، والمسوقين، والمصممين الذين يحتاجون إلى مواد بصرية سريعة عالية الجودة.

واحدة من أكثر العروض إثارة للإعجاب تتضمن توليد واجهات متداخلة: يمكن للنموذج إنتاج صورة حيث تظهر نافذة VSCode مفتوحة على Qwen Chat، وداخلها تظهر واجهة WeChat، والتي تحتوي على ملصق. كل هذه العناصر في وقت واحد، في توليد واحد، مع نص مقروء بالكامل.

نص بحجم 10 بكسل: التغلب على كعب أخيل للذكاء الاصطناعي

كان أحد أكبر التحديات في توليد الصور بالذكاء الاصطناعي دائماً هو عرض النص بدقة وبشكل مقروء. معظم النماذج تواجه صعوبة مع النص الصغير أو المنسق بشكل معقد. Qwen-Image-3.0 يحل هذه المشكلة بشكل جذري: يمكنه عرض نص صغير يصل إلى 10 بكسل بشكل واضح مقروء. هذا يعني أنه حتى البيانات المكتوبة بخط صغير في الرسوم البيانية والجداول والمخططات يمكن قراءتها بسهولة.

ولكن هذا ليس كل شيء. Qwen-Image-3.0 يفهم صيغ LaTeX — فهو يعرض بدقة الرموز السفلية والرموز العلوية والكسور. هذا يجعل النموذج لا يقدر بثمن لإنشاء المحتوى الأكاديمي والعلمي، حيث يكون العرض الدقيق للصيغ الرياضية ضرورياً.

دعم 12 لغة

Qwen-Image-3.0 يدعم 12 لغة بشكل أصلي، بما في ذلك الجورجية والإنجليزية والصينية والعربية والإسبانية والفرنسية والألمانية واليابانية والكورية والروسية والبرتغالية والإيطالية. هذا يعني أن المستخدمين يمكنهم إنشاء محتوى بلغات متعددة بنص ليس فقط مقروءاً ولكن أيضاً صحيحاً نحوياً.

تفاصيل فوتوغرافية

Qwen-Image-3.0 لا يقتصر على النص والرسوم البيانية. يمكنه أيضاً توليد صور فوتوغرافية فائقة الواقعية بتفاصيل مذهلة: مسام الجلد، نسيج الجلد، خصلات شعر فردية — كلها تُعرض بدقة تجعل من الصعب أحياناً التمييز بين الصورة المولدة بالذكاء الاصطناعي والصورة الفوتوغرافية الحقيقية.

تحرير الصور وبيانات الإنترنت الحية

Qwen-Image-3.0 يتمتع أيضاً بقدرات تحرير الصور. أحد العروض يوضح كيف يستعيد النموذج لوحة حبر تالفة — بدقة تجعل من الصعب التمييز بين الأصل والنسخة المستعادة.

ابتكار مهم آخر هو القدرة على استخدام بيانات الإنترنت الحية. يمكن للنموذج توليد صور تعكس البيانات الحالية — على سبيل المثال، تصور توقعات الطقس. هذا يجعله مفيداً بشكل خاص للمحتوى الديناميكي الذي يحتاج إلى البقاء محدثاً.

التوفر

حالياً، Qwen-Image-3.0 متوفر حصرياً من خلال API بدعوة فقط. هذا يعني أنه قبل الفتح للجمهور العام، تقوم Alibaba بجمع الملاحظات وضبط النموذج.

من المثير للاهتمام أن Qwen-Image-2.0 تم إطلاقه قبل بضعة أشهر فقط، في مايو 2026. هذا التقدم السريع يشير إلى الاستثمار المكثف من Alibaba في مجال توليد الصور بالذكاء الاصطناعي.

Qwen-Image-3.0 يمثل خطوة مهمة إلى الأمام في تطور توليد الصور بالذكاء الاصطناعي. إنه ليس مجرد أداة لإنشاء صور جميلة — إنه مساعد عملي يفهم النص والبيانات والصيغ والتصميم. قدرته على إنشاء تخطيطات معقدة وكثيفة بنص مقروء في تمريرة واحدة تفتح إمكانيات جديدة لمنشئي المحتوى والباحثين والشركات في جميع أنحاء العالم.

Source: The Decoder