Վերադառնալ
Qwen-Image-2.1՝ 7B կոմպակտ մոդել՝ պատկերների ստեղծման և խմբագրման միասնական լուծում
SiTech Team2 წთ. საკითხავი

Qwen-Image-2.1՝ 7B կոմպակտ մոդել՝ պատկերների ստեղծման և խմբագրման միասնական լուծում

Qwen-ը բաց կոդով հրապարակել է Qwen-Image-2.1-ը՝ պատկերների մոդել, որի վիզուալ գեներացիայի բաղադրիչն ունի 7B պարամետր և միավորում է տեքստից պատկերի ստեղծումն ու խմբագրումը մեկ ցանցում։

Կոմպակտ 7B ճարտարապետություն

Qwen-ը բաց կոդով հրապարակել է Qwen-Image-2.1-ը՝ պատկերների մոդել, որը, թիմի նկարագրությամբ, հավասարակշռում է գեներացիայի որակը, ինֆերենսի արդյունավետությունը և ծախսը։ Այն միավորում է տեքստից պատկերի ստեղծումը և պատկերների խմբագրումը մեկ մոդելում, որի վիզուալ գեներացիայի բաղադրիչը պարունակում է 7B պարամետր և ի սկզբանե աջակցում է թափանցիկ պատկերներին։

Բաղադրիչը կազմված է 32 Single-Stream DiT շերտից։ Qwen-ի խոսքով՝ կոմպակտ չափը չի վնասում գեներացիայի որակին, իսկ ինֆերենսի արդյունավետությունը առանձնահատուկ ուշադրության կենտրոնում է եղել մի քանի մուտքային պատկերով խմբագրման դեպքում։ Դրան նպաստում է խառը հատիկավորության ուշադրության ճարտարապետությունը. տեքստը՝ ներառյալ համակարգային նախածանցը և խմբագրման հրահանգները, օգտագործում է պատճառական դիմակ թոքենի մակարդակով, իսկ պատկերի գեներացիան՝ բլոկի մակարդակով։ KV քեշի կրկնակի օգտագործումը մուտքային պատկերներն ու հրահանգները դարձնում է ստատիկ կոնտեքստ, որը հաշվարկվում և քեշավորվում է առաջին քայլին. դա արագացնում է ինֆերենսը և նվազեցնում հիշողության սպառումը։

Թափանցիկությունը մեկ մոդելում

2025 թվականի դեկտեմբերին ներկայացված Qwen-Image-Layered-ը առանձին մոդել էր թափանցիկ պատկերների գեներացիայի համար։ Qwen-Image-2.1-ը այդ հնարավորությունը ներառում է միասնական մոդելում և ըստ հուշումի որոշում է՝ սովորական պատկեր տա, թե թափանցիկության ալիքով պատկեր։ Քանի որ գեներացիան ու խմբագրումը միավորված են, թափանցիկ պատկերները հնարավոր է խմբագրել ուղղակիորեն՝ օրինակ փոխել կերպարի դիմախաղը՝ պահպանելով թափանցիկ ֆոնը։ Նույնը վերաբերում է լուսանկարներին. RGB պատկերից մոդելը կարող է առանձնացնել ցանկալի օբյեկտը որպես RGBA շերտ, ինչը հեշտացնում է տարրերի կրկնակի օգտագործումը դիզայնում ու կոմպոզիցիայում։

Խմբագրում՝ մինչև 10 հղումային պատկերով

Qwen-ը նշում է խմբագրման բարելավման չորս ուղղություն՝ բազմաթիվ հղումներ, տեղային խմբագրում, հավատարմություն և առաջադրանքների ընդգրկույթ։ Մոդելն ընդունում է մինչև 10 հղումային պատկեր և կարող է առանձին կերպարներ ու ակտիվներ միավորել մեկ կոմպոզիցիայում՝ վեց դիմանկար՝ մեկ խմբակային լուսանկարում, հանդերձանք՝ հինգ հղումից, սենյակի դասավորություն՝ կահույքի 10 պատկերից։

Տեղային փոփոխությունները նշվում են շրջանակներով, ներկված նշումներով կամ առանձին դիմակով. մուտքային պատկերն անփոփոխ պահելու համար բնօրինակն ու դիմակը կարելի է ներկայացնել որպես երկու առանձին մուտք։ Հավատարմության աշխատանքները վերաբերում են դիմանկարի ինքնությանն ու ապրանքի հետևողականությանը. դեմքի գծերը խմբագրումների ընթացքում ավելի կայուն են մնում, իսկ ապրանքի տեքստը, հյուսվածքն ու ձևը պահպանվում են։ Առաջադրանքների թվում են սելֆիից ստացված պանորամաները, մոդելի լուսանկարից ընդլայնված ինֆոգրաֆիկաները և երեք դիտակետով կերպարի հղումից կառուցված ստորիբորդները։

Թողարկումը բարելավում է նաև տիպոգրաֆիկան և դիմանկարների ռենդերինգը. տեքստի արտաբերման ժամանակ հաշվի են առնվում տառատեսակի ոճն ու դասավորությունը։ Qwen-Image-2.1-ը հասանելի է GitHub-ում, Hugging Face-ում և ModelScope-ում, իսկ թիմը ներկայացնում է այն որպես գործնական գործիք դիզայնի, բովանդակության ստեղծման, էլեկտրոնային առևտրի և վիզուալ պատմվածքի համար։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։