უკან დაბრუნება
Qwen-Image-2.1: კომპაქტური 7B მოდელი, რომელიც გენერაციასა და რედაქტირებას აერთიანებს
SiTech Team2 წთ. საკითხავი

Qwen-Image-2.1: კომპაქტური 7B მოდელი, რომელიც გენერაციასა და რედაქტირებას აერთიანებს

Qwen-მა ღია კოდით გამოაქვეყნა Qwen-Image-2.1 — ერთიანი მოდელი, რომლის ვიზუალური გენერაციის კომპონენტი 7B პარამეტრს მოიცავს და ტექსტიდან სურათის გენერაციას, გამჭვირვალე ფენებსა და რედაქტირებას აერთიანებს.

კომპაქტური 7B არქიტექტურა

Qwen-მა ღია კოდით გამოაქვეყნა Qwen-Image-2.1 — სურათების მოდელი, რომელიც, გუნდის აღწერით, გენერაციის ხარისხს, ინფერენსის ეფექტურობასა და ხარჯს შორის ბალანსს ინარჩუნებს. მოდელი ტექსტიდან სურათის გენერაციასა და სურათების რედაქტირებას ერთ ქსელში აერთიანებს; ვიზუალური გენერაციის კომპონენტი 7B პარამეტრს მოიცავს და გამჭვირვალე სურათებს თავდაპირველად უჭერს მხარს.

კომპონენტი 32 Single-Stream DiT ფენისგან შედგება. Qwen-ის თანახმად, მცირე ზომა გენერაციის ხარისხს არ აზიანებს, ინფერენსის ეფექტურობა კი განსაკუთრებით მნიშვნელოვანი იყო მრავალი შემავალი სურათით რედაქტირებისას. ამას შერეული გრანულარობის ყურადღების არქიტექტურა უზრუნველყოფს: ტექსტი — სისტემური პრეფიქსი და რედაქტირების ინსტრუქციები — ტოკენის დონის კაუზალურ ნიღაბს იყენებს, სურათის გენერაცია კი ბლოკის დონის ნიღაბს. KV ქეშის ხელახალი გამოყენება შემავალ სურათებსა და ინსტრუქციებს სტატიკურ კონტექსტად აქცევს: ისინი პირველ საფეხურზე გამოითვლება და ქეშირდება, რაც ინფერენსს აჩქარებს და მეხსიერების მოხმარებას ამცირებს.

გამჭვირვალობა ერთიან მოდელში

2025 წლის დეკემბერში წარმოდგენილი Qwen-Image-Layered გამჭვირვალე სურათების გენერაციისთვის განკუთვნილი ცალკე მოდელი იყო. Qwen-Image-2.1 ამ შესაძლებლობას ერთიან მოდელში აერთიანებს და პრომპტის მიხედვით წყვეტს, ჩვეულებრივი სურათი გამოიტანოს თუ გამჭვირვალობის არხის მქონე. ვინაიდან გენერაცია და რედაქტირება გაერთიანებულია, გამჭვირვალე სურათების პირდაპირ რედაქტირებაც შესაძლებელია — მაგალითად, პერსონაჟის გამომეტყველების შეცვლა გამჭვირვალე ფონის შენარჩუნებით. იგივე ეხება ფოტოებს: RGB სურათიდან მოდელს სასურველი ობიექტის RGBA ფენად გამოყოფა შეუძლია, რაც დიზაინსა და კომპოზიციაში ელემენტების ხელახლა გამოყენებას აადვილებს.

რედაქტირება 10-მდე საცნობი სურათით

Qwen რედაქტირების ოთხ გაუმჯობესებას ასახელებს: მრავალი საცნობი სურათი, ლოკალური ცვლილებები, ერთგულება და ამოცანების სპექტრი. მოდელი 10-მდე საცნობ სურათს იღებს და ცალკეული პერსონაჟებისა და აქტივების ერთ კომპოზიციაში გაერთიანება შეუძლია: ექვსი პორტრეტი ერთ ჯგუფურ ფოტოში, კოსტიუმი ხუთი საცნობი სურათიდან, ოთახის მოწყობა ავეჯის 10 სურათიდან.

ლოკალური ცვლილება წრეებით, მოხატული ნიშნებით ან ცალკე ნიღბით მიეთითება; შემავალი სურათის უცვლელად შესანარჩუნებლად ორიგინალი და ნიღაბი ორ ცალკე შემავალადაც შეიძლება გაიგზავნოს. ერთგულების გაუმჯობესება პორტრეტის იდენტობასა და პროდუქტის თანმიმდევრულობას ეხება: სახის ნაკვთები რედაქტირებებს შორის უფრო სტაბილურად ნარჩუნდება, პროდუქტის ტექსტი, ტექსტურა და ფორმა კი უცვლელი რჩება. ამოცანების სპექტრი მოიცავს სელფიდან გენერირებულ პანორამებს, მოდელის ფოტოდან გაფართოებულ ინფოგრაფიკებს და სამი ხედვის პერსონაჟის რეფერენსიდან აწყობილ სთორიბორდებს.

გამოშვება ასევე აუმჯობესებს ტიპოგრაფიასა და პორტრეტების რენდერინგს: ტექსტის გამოსახვისას მოდელი შრიფტის სტილსა და განლაგებას ითვალისწინებს. Qwen-Image-2.1 ხელმისაწვდომია GitHub-ზე, Hugging Face-სა და ModelScope-ზე; გუნდი მას დიზაინის, კონტენტის შექმნის, ელექტრონული კომერციისა და ვიზუალური თხრობის პრაქტიკულ ინსტრუმენტად წარმოაჩენს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.