Qwen-ը փաստաթղթավորել է Qwen-Image-2.1-ի տեղային գեներացման, խմբագրման և RGBA աշխատանքային հոսքերը
Qwen-ի մոդելի նկարագրությունը փաստաթղթավորում է տեղային Diffusers աշխատանքային հոսքեր Qwen-Image-2.1-ի համար՝ ներառելով տեքստից գեներացումը, մուտքային պատկերի խմբագրումը, հստակ հուշումով RGBA արտածումը, թափանցիկ շերտերի խմբագրումն ու լուսանկարներից օբյեկտների հայտարարված առանձնացումը: Նշվում է 7B վիզուալ գեներացման բաղադրիչի և խմբագրման մինչև 10 հղման պատկերի մասին, մինչդեռ տրամադրված փաստերը չեն պարունակում արտադրողականության անկախ ստուգումներ կամ հետազոտական լիցենզիայի ամբողջական պայմանները: [1]
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:
Qwen-ի Hugging Face էջում Qwen-Image-2.1-ը ներկայացված է որպես տեքստից պատկերի ստեղծման և պատկերների խմբագրման միասնական մոդել՝ գեներացման, խմբագրման ու թափանցիկ RGBA արտածման համար տեղային Diffusers օրինակներով: Qwen-ը նաև նշում է, որ այն կարող է խմբագրել թափանցիկ շերտեր և առանձնացնել օբյեկտները լուսանկարներից, սակայն տրամադրված տվյալներում այս հնարավորությունները, արտածման որակը, ռեսուրսների պահանջներն ու լիցենզիայի սահմանափակումներն անկախ ստուգում չեն անցել: [1]
01
Ինչ գիտենք այս պահին
- 01
Qwen-ի Hugging Face մոդելի նկարագրության մեջ Qwen-Image-2.1-ը ներկայացված է որպես տեքստից պատկերի ստեղծման և պատկերների խմբագրման միասնական մոդել, ինչպես նաև տրամադրված են տեղային Diffusers օրինակներ: [1]
- 02
Նկարագրության մեջ նշվում է, որ մոդելն աջակցում է թափանցիկ RGBA գեներացմանը, թափանցիկ շերտերի խմբագրմանը, լուսանկարներից օբյեկտների առանձնացմանը և խմբագրման մինչև 10 հղման պատկերների: [1]
- 03
Ռեպոզիտորիայի մետատվյալներում նշված են text-to-image pipeline-ի պիտակը, Diffusers-ը և Qwen Research License Agreement-ը: [1]
02
Վիզուալ գեներացման բաղադրիչի նշված չափը
Qwen-ի մոդելի նկարագրության մեջ նշվում է, որ վիզուալ գեներացման բաղադրիչն ունի 7B պարամետր:Խմբագրման համար հղման պատկերների նշված սահմանաչափը
Ըստ նկարագրության՝ խմբագրման աշխատանքային հոսքերում կարելի է օգտագործել մինչև 10 հղման պատկեր:Փաստաթղթավորված թափանցիկ արտածման ձևաչափը
Նկարագրված է RGBA գեներացում՝ թափանցիկություն և ալֆա ալիք պահանջող հուշումների կիրառմամբ:Pipeline-ի նշված առաջադրանքը
Ռեպոզիտորիայի մետատվյալներում pipeline-ի պիտակը նշված է որպես text-to-image:Ներկայացված բոլոր հնարավորություններն ու կարգավորումների մանրամասները վերցված են Qwen-ի մոդելի նկարագրությունից և անկախ փորձարկում չեն անցել: [1]
03
Փաստաթղթավորված տեղային պատկերային pipeline
Qwen-ի պաշտոնական նկարագրությունը պարունակում է Python-ի օրինակներ՝ Diffusers-ում `QwenImage21Pipeline`-ի կիրառմամբ: Գեներացման օրինակը բեռնում է `Qwen/Qwen-Image-2.1`-ը bfloat16 ճշգրտությամբ, տեղափոխում pipeline-ը CUDA միջավայր և տեքստային հուշումից ստեղծում պատկեր: Առանձին օրինակում բացվում է մուտքային պատկերը և փոխանցվում խմբագրման հրահանգի հետ միասին: [1]
- Ռեպոզիտորիայի մետատվյալներում Qwen-Image-2.1-ը նշված է որպես text-to-image pipeline, իսկ պիտակների շարքում ներառված են Diffusers-ը, պատկերների գեներացումը, պատկերների խմբագրումը և RGBA-ն:
- Qwen-ը checkpoint-ը ներկայացնում է որպես միասնական մոդել՝ տեքստի հիման վրա պատկերներ ստեղծելու և տրամադրված պատկերները խմբագրելու համար:
- Նկարագրության մեջ նշվում է, որ վիզուալ գեներացման բաղադրիչն ունի 7B պարամետր. սա մատակարարի հայտարարությունն է, ոչ թե անկախ ստուգված ցուցանիշ:
04
Թափանցիկության և խմբագրման աշխատանքային հոսք
Մոդելի նկարագրությունը փաստաթղթավորում է թափանցիկ պատկերի օրինակ, որը պահպանում է արդյունքը ալֆա ալիք պահանջող հուշումից հետո: Այն նաև որպես աջակցվող գործառույթներ է ներկայացնում թափանցիկ շերտերի խմբագրումն ու լուսանկարներից օբյեկտների առանձնացումը: Այդ գործառույթները, ինչպես նաև խմբագրման նշված վերահսկման գործիքներն ու արդյունքները, մնում են մատակարարի կողմից նշված հնարավորություններ, այլ ոչ թե անկախ կերպով հաստատված ցուցանիշներ: [1]
- Qwen-ը նշում է, որ մոդելը կարող է գեներացնել թափանցիկ RGBA պատկերներ, խմբագրել թափանցիկ շերտեր և առանձնացնել օբյեկտներ լուսանկարներից:
- Թափանցիկ արտածման համար նկարագրությունը խորհուրդ է տալիս հստակ պահանջել RGBA պատկեր՝ ալֆա ալիքով և թափանցիկ ֆոնով:
- Ըստ նկարագրության՝ խմբագրումը կարող է օգտագործել մինչև 10 հղման պատկեր և կարող է սահմանել տեղային փոփոխություններ շրջանագծերի, նկարված նշումների կամ առանձին դիմակների (masks) միջոցով:
- Qwen-ը նաև հայտարարում է խմբագրման ընթացքում մարդկանց և ապրանքների ինքնության պահպանման մասին, սակայն տրամադրված տվյալներում դա անկախ ստուգում չի անցել:
05
Տեղային կարգավորման մանրամասներ
Տեղադրման հրահանգներում նշված են PyTorch 2.4 կամ ավելի նոր տարբերակը, Transformers 5.17 կամ ավելի նորը, GitHub-ի աղբյուրից տեղադրված Diffusers-ը, Accelerate-ը և Pillow-ն: Տրամադրված օրինակներն օգտագործում են CUDA և bfloat16: Դրանք փաստաթղթավորում են տեղային կարգավորման մեկ մոտեցում, սակայն նյութը չի տրամադրում անկախ ստուգված համատեղելիության մատրից, սարքակազմի պահանջներ, հիշողության ծավալի ցուցանիշ կամ ինֆերենսի ծախսի գնահատական: [1]
- Նկարագրության մեջ բերված են կողմերի հարաբերակցության (aspect ratio) յոթ օրինակներ՝ քառակուսի 2048x2048-ից մինչև հորիզոնական 2752x1536 և ուղղաձիգ 1536x2752:
- Օրինակներում օգտագործվում է ինֆերենսի 40 քայլ և seeded CUDA գեներատոր: Այս կարգավորումներն ընդամենը օրինակներ են, ոչ թե ապացույց, որ դրանք պարտադիր են կամ օպտիմալ:
- Հիշողության օպտիմալացման համար նկարագրության մեջ ցուցադրված է `enable_model_cpu_offload()` ֆունկցիան:
06
Նախազգուշացումներ ներդրման վերաբերյալ
Մոդելի նկարագրությունն ուրվագծում է տեղային գնահատման ուղի, բայց հիմք չէ արտադրական (production) կիրառման պատրաստության մասին եզրակացնելու համար: Հետաքրքրված օգտատերերը պետք է ուսումնասիրեն հղված լիցենզիան և փորձարկեն checkpoint-ը սեփական առաջադրանքների վրա: Պատկերի որակի, ցածր հաշվարկային ծախսի, տպագրության (typography), տեքստուրայի, ինքնության պահպանման և խմբագրման արդյունքների մասին պնդումները պետք է դիտարկվեն որպես Qwen-ի հայտարարություններ, քանի դեռ դրանք անկախ գնահատում չեն անցել: [1]
- Մոդելը նշված է որպես լիցենզավորված Qwen Research License Agreement-ի ներքո:
- Ձեռք բերված տվյալները չեն ներառում համաձայնագրի տեքստը, ուստի այս տեղեկագրից հնարավոր չէ որոշել թույլատրելի օգտագործումը կամ սահմանափակումները:
- Փաթեթում ներառված չեն անկախ արտադրողականության, համակարգային պահանջների կամ գործառնական ծախսերի վերաբերյալ փաստեր:
07
Աղբյուրը և անհայտ մնացած հարցերը
Հասանելի հիմնական աղբյուրը Qwen-ի Hugging Face մոդելի նկարագրության էջն է: Այն արձանագրում է checkpoint-ի փաստաթղթավորված օրինակներն ու մատակարարի նշած հնարավորությունները, սակայն անկախ կերպով չի հաստատում գործնական որակը, համակարգային համատեղելիությունը, ռեսուրսների պահանջները, գործառնական ծախսերը կամ լիցենզիայի ամբողջական պայմանները: [1]
- Հիմնական աղբյուր՝ Qwen-ի մոդելի էջը Hugging Face-ում՝ https://huggingface.co/Qwen/Qwen-Image-2.1
- Էջը հղում է կատարում GitHub ռեպոզիտորիային, բլոգին, դեմոյին և լիցենզիոն ֆայլին, սակայն դրանց հասանելիությունն ու բովանդակությունը տրամադրված տվյալներում անկախ ձևով ձեռք չեն բերվել:
08
Գործնական առաջիկա քայլեր
Մոդելի նկարագրության էջը (model card) տրամադրում է տեղային գնահատման ելակետային տարբերակ, սակայն դրա հնարավորություններն ու հայտարարված արդյունավետությունը տրամադրված նյութերում անկախ փորձարկում չեն անցել: [1]
- 01
Նախքան checkpoint-ը ներբեռնելը կամ օգտագործելը ծանոթացեք Qwen Research License Agreement-ի դրույթներին. տրամադրված փաստերը նշում են լիցենզիան, սակայն չեն պարունակում դրա ամբողջական պայմանները: [1]
- 02
Տեղադրեք նկարագրության մեջ նշված կախվածությունները (dependencies)՝ PyTorch 2.4 կամ ավելի նոր տարբերակը, Transformers 5.17 կամ ավելի նորը, Diffusers-ը GitHub-ի աղբյուրից, Accelerate-ը և Pillow-ն: [1]
- 03
Նախքան մոդելի վրա հիմնվելը փորձարկեք փաստաթղթավորված CUDA և bfloat16 կարգավորումները պատկերների գեներացման, խմբագրման, թափանցիկ շերտերի խմբագրման և օբյեկտների առանձնացման բնորոշ առաջադրանքների վրա: [1]
- 04
Թափանցիկ պատկերների թեստերի համար օգտագործեք հուշում (prompt), որը հստակ պահանջում է RGBA պատկեր, ալֆա ալիք (alpha channel) և թափանցիկ ֆոն, ինչպես խորհուրդ է տալիս Qwen-ը: [1]
09
Այս թողարկման սահմանափակումները
Տրամադրված փաստերը չեն պարունակում անկախ արտադրողականության թեստեր (benchmarks), որակի ստուգումներ, սարքակազմի պահանջներ կամ ինֆերենսի ծախսերի գնահատականներ: [1]
Որակի, արդյունավետության, խմբագրման արդյունքների, թափանցիկ շերտերի խմբագրման, օբյեկտների առանձնացման և այլ հնարավորությունների մասին պնդումները Qwen-ի հայտարարություններն են մոդելի նկարագրությունում, այլ ոչ թե անկախ հաստատված արդյունքներ: [1]
Qwen Research License Agreement-ի ամբողջական տեքստը չի տրամադրվել, ուստի դրա թույլտվություններն ու սահմանափակումները հնարավոր չէ գնահատել այս նյութի հիման վրա: [1]
Մոդելի նկարագրության տեքստում հրապարակման կամ թարմացման ամսաթիվ նշված չէ: [1]
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:



