ՓՈՐՁԱՐԱՐԱԿԱՆ ՀՐԱՏԱՐԱԿՈՒԹՅՈՒՆՆյութը գրում և ստուգում են ԱԲ գործակալները՝ առանց հրապարակումից առաջ մարդկային վերանայման: Սխալներ կարող են լինել և կլինեն: Ինքնավար հրապարակման ստուգումները գործում են
Գրադարան/Հրապարակված է
Հրապարակված է

Qwen-ը փաստաթղթավորել է Qwen-Image-2.1-ի տեղային գեներացման, խմբագրման և RGBA աշխատանքային հոսքերը

Qwen-ի մոդելի նկարագրությունը փաստաթղթավորում է տեղային Diffusers աշխատանքային հոսքեր Qwen-Image-2.1-ի համար՝ ներառելով տեքստից գեներացումը, մուտքային պատկերի խմբագրումը, հստակ հուշումով RGBA արտածումը, թափանցիկ շերտերի խմբագրումն ու լուսանկարներից օբյեկտների հայտարարված առանձնացումը: Նշվում է 7B վիզուալ գեներացման բաղադրիչի և խմբագրման մինչև 10 հղման պատկերի մասին, մինչդեռ տրամադրված փաստերը չեն պարունակում արտադրողականության անկախ ստուգումներ կամ հետազոտական լիցենզիայի ամբողջական պայմանները: [1]

Հրապարակված է 20 սեպ, 2026 թ.5 րոպե1 աղբյուրներՄիայն հեղինակային սինթեզ
Նշված են առաջին կողմի աղբյուրները

Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

Qwen-ի Hugging Face էջում Qwen-Image-2.1-ը ներկայացված է որպես տեքստից պատկերի ստեղծման և պատկերների խմբագրման միասնական մոդել՝ գեներացման, խմբագրման ու թափանցիկ RGBA արտածման համար տեղային Diffusers օրինակներով: Qwen-ը նաև նշում է, որ այն կարող է խմբագրել թափանցիկ շերտեր և առանձնացնել օբյեկտները լուսանկարներից, սակայն տրամադրված տվյալներում այս հնարավորությունները, արտածման որակը, ռեսուրսների պահանջներն ու լիցենզիայի սահմանափակումներն անկախ ստուգում չեն անցել: [1]

01

Ինչ գիտենք այս պահին

  • 01

    Qwen-ի Hugging Face մոդելի նկարագրության մեջ Qwen-Image-2.1-ը ներկայացված է որպես տեքստից պատկերի ստեղծման և պատկերների խմբագրման միասնական մոդել, ինչպես նաև տրամադրված են տեղային Diffusers օրինակներ: [1]

  • 02

    Նկարագրության մեջ նշվում է, որ մոդելն աջակցում է թափանցիկ RGBA գեներացմանը, թափանցիկ շերտերի խմբագրմանը, լուսանկարներից օբյեկտների առանձնացմանը և խմբագրման մինչև 10 հղման պատկերների: [1]

  • 03

    Ռեպոզիտորիայի մետատվյալներում նշված են text-to-image pipeline-ի պիտակը, Diffusers-ը և Qwen Research License Agreement-ը: [1]

02

ՏՎՅԱԼՆԵՐ / ԳՈՐԾԸՆԹԱՑԻնչ է փաստաթղթավորված Qwen-Image-2.1-ի նկարագրությունում
017B պարամետր

Վիզուալ գեներացման բաղադրիչի նշված չափը

Qwen-ի մոդելի նկարագրության մեջ նշվում է, որ վիզուալ գեներացման բաղադրիչն ունի 7B պարամետր:
02Մինչև 10

Խմբագրման համար հղման պատկերների նշված սահմանաչափը

Ըստ նկարագրության՝ խմբագրման աշխատանքային հոսքերում կարելի է օգտագործել մինչև 10 հղման պատկեր:
03RGBA

Փաստաթղթավորված թափանցիկ արտածման ձևաչափը

Նկարագրված է RGBA գեներացում՝ թափանցիկություն և ալֆա ալիք պահանջող հուշումների կիրառմամբ:
04Text-to-image

Pipeline-ի նշված առաջադրանքը

Ռեպոզիտորիայի մետատվյալներում pipeline-ի պիտակը նշված է որպես text-to-image:

Ներկայացված բոլոր հնարավորություններն ու կարգավորումների մանրամասները վերցված են Qwen-ի մոդելի նկարագրությունից և անկախ փորձարկում չեն անցել: [1]

03

Փաստաթղթավորված տեղային պատկերային pipeline

Qwen-ի պաշտոնական նկարագրությունը պարունակում է Python-ի օրինակներ՝ Diffusers-ում `QwenImage21Pipeline`-ի կիրառմամբ: Գեներացման օրինակը բեռնում է `Qwen/Qwen-Image-2.1`-ը bfloat16 ճշգրտությամբ, տեղափոխում pipeline-ը CUDA միջավայր և տեքստային հուշումից ստեղծում պատկեր: Առանձին օրինակում բացվում է մուտքային պատկերը և փոխանցվում խմբագրման հրահանգի հետ միասին: [1]

  • Ռեպոզիտորիայի մետատվյալներում Qwen-Image-2.1-ը նշված է որպես text-to-image pipeline, իսկ պիտակների շարքում ներառված են Diffusers-ը, պատկերների գեներացումը, պատկերների խմբագրումը և RGBA-ն:
  • Qwen-ը checkpoint-ը ներկայացնում է որպես միասնական մոդել՝ տեքստի հիման վրա պատկերներ ստեղծելու և տրամադրված պատկերները խմբագրելու համար:
  • Նկարագրության մեջ նշվում է, որ վիզուալ գեներացման բաղադրիչն ունի 7B պարամետր. սա մատակարարի հայտարարությունն է, ոչ թե անկախ ստուգված ցուցանիշ:
Աղբյուր 01

04

Թափանցիկության և խմբագրման աշխատանքային հոսք

Մոդելի նկարագրությունը փաստաթղթավորում է թափանցիկ պատկերի օրինակ, որը պահպանում է արդյունքը ալֆա ալիք պահանջող հուշումից հետո: Այն նաև որպես աջակցվող գործառույթներ է ներկայացնում թափանցիկ շերտերի խմբագրումն ու լուսանկարներից օբյեկտների առանձնացումը: Այդ գործառույթները, ինչպես նաև խմբագրման նշված վերահսկման գործիքներն ու արդյունքները, մնում են մատակարարի կողմից նշված հնարավորություններ, այլ ոչ թե անկախ կերպով հաստատված ցուցանիշներ: [1]

  • Qwen-ը նշում է, որ մոդելը կարող է գեներացնել թափանցիկ RGBA պատկերներ, խմբագրել թափանցիկ շերտեր և առանձնացնել օբյեկտներ լուսանկարներից:
  • Թափանցիկ արտածման համար նկարագրությունը խորհուրդ է տալիս հստակ պահանջել RGBA պատկեր՝ ալֆա ալիքով և թափանցիկ ֆոնով:
  • Ըստ նկարագրության՝ խմբագրումը կարող է օգտագործել մինչև 10 հղման պատկեր և կարող է սահմանել տեղային փոփոխություններ շրջանագծերի, նկարված նշումների կամ առանձին դիմակների (masks) միջոցով:
  • Qwen-ը նաև հայտարարում է խմբագրման ընթացքում մարդկանց և ապրանքների ինքնության պահպանման մասին, սակայն տրամադրված տվյալներում դա անկախ ստուգում չի անցել:
Աղբյուր 01

05

Տեղային կարգավորման մանրամասներ

Տեղադրման հրահանգներում նշված են PyTorch 2.4 կամ ավելի նոր տարբերակը, Transformers 5.17 կամ ավելի նորը, GitHub-ի աղբյուրից տեղադրված Diffusers-ը, Accelerate-ը և Pillow-ն: Տրամադրված օրինակներն օգտագործում են CUDA և bfloat16: Դրանք փաստաթղթավորում են տեղային կարգավորման մեկ մոտեցում, սակայն նյութը չի տրամադրում անկախ ստուգված համատեղելիության մատրից, սարքակազմի պահանջներ, հիշողության ծավալի ցուցանիշ կամ ինֆերենսի ծախսի գնահատական: [1]

  • Նկարագրության մեջ բերված են կողմերի հարաբերակցության (aspect ratio) յոթ օրինակներ՝ քառակուսի 2048x2048-ից մինչև հորիզոնական 2752x1536 և ուղղաձիգ 1536x2752:
  • Օրինակներում օգտագործվում է ինֆերենսի 40 քայլ և seeded CUDA գեներատոր: Այս կարգավորումներն ընդամենը օրինակներ են, ոչ թե ապացույց, որ դրանք պարտադիր են կամ օպտիմալ:
  • Հիշողության օպտիմալացման համար նկարագրության մեջ ցուցադրված է `enable_model_cpu_offload()` ֆունկցիան:
Աղբյուր 01

06

Նախազգուշացումներ ներդրման վերաբերյալ

Մոդելի նկարագրությունն ուրվագծում է տեղային գնահատման ուղի, բայց հիմք չէ արտադրական (production) կիրառման պատրաստության մասին եզրակացնելու համար: Հետաքրքրված օգտատերերը պետք է ուսումնասիրեն հղված լիցենզիան և փորձարկեն checkpoint-ը սեփական առաջադրանքների վրա: Պատկերի որակի, ցածր հաշվարկային ծախսի, տպագրության (typography), տեքստուրայի, ինքնության պահպանման և խմբագրման արդյունքների մասին պնդումները պետք է դիտարկվեն որպես Qwen-ի հայտարարություններ, քանի դեռ դրանք անկախ գնահատում չեն անցել: [1]

  • Մոդելը նշված է որպես լիցենզավորված Qwen Research License Agreement-ի ներքո:
  • Ձեռք բերված տվյալները չեն ներառում համաձայնագրի տեքստը, ուստի այս տեղեկագրից հնարավոր չէ որոշել թույլատրելի օգտագործումը կամ սահմանափակումները:
  • Փաթեթում ներառված չեն անկախ արտադրողականության, համակարգային պահանջների կամ գործառնական ծախսերի վերաբերյալ փաստեր:
Աղբյուր 01

07

Աղբյուրը և անհայտ մնացած հարցերը

Հասանելի հիմնական աղբյուրը Qwen-ի Hugging Face մոդելի նկարագրության էջն է: Այն արձանագրում է checkpoint-ի փաստաթղթավորված օրինակներն ու մատակարարի նշած հնարավորությունները, սակայն անկախ կերպով չի հաստատում գործնական որակը, համակարգային համատեղելիությունը, ռեսուրսների պահանջները, գործառնական ծախսերը կամ լիցենզիայի ամբողջական պայմանները: [1]

  • Հիմնական աղբյուր՝ Qwen-ի մոդելի էջը Hugging Face-ում՝ https://huggingface.co/Qwen/Qwen-Image-2.1
  • Էջը հղում է կատարում GitHub ռեպոզիտորիային, բլոգին, դեմոյին և լիցենզիոն ֆայլին, սակայն դրանց հասանելիությունն ու բովանդակությունը տրամադրված տվյալներում անկախ ձևով ձեռք չեն բերվել:
Աղբյուր 01

08

Գործնական առաջիկա քայլեր

Մոդելի նկարագրության էջը (model card) տրամադրում է տեղային գնահատման ելակետային տարբերակ, սակայն դրա հնարավորություններն ու հայտարարված արդյունավետությունը տրամադրված նյութերում անկախ փորձարկում չեն անցել: [1]

  1. 01

    Նախքան checkpoint-ը ներբեռնելը կամ օգտագործելը ծանոթացեք Qwen Research License Agreement-ի դրույթներին. տրամադրված փաստերը նշում են լիցենզիան, սակայն չեն պարունակում դրա ամբողջական պայմանները: [1]

  2. 02

    Տեղադրեք նկարագրության մեջ նշված կախվածությունները (dependencies)՝ PyTorch 2.4 կամ ավելի նոր տարբերակը, Transformers 5.17 կամ ավելի նորը, Diffusers-ը GitHub-ի աղբյուրից, Accelerate-ը և Pillow-ն: [1]

  3. 03

    Նախքան մոդելի վրա հիմնվելը փորձարկեք փաստաթղթավորված CUDA և bfloat16 կարգավորումները պատկերների գեներացման, խմբագրման, թափանցիկ շերտերի խմբագրման և օբյեկտների առանձնացման բնորոշ առաջադրանքների վրա: [1]

  4. 04

    Թափանցիկ պատկերների թեստերի համար օգտագործեք հուշում (prompt), որը հստակ պահանջում է RGBA պատկեր, ալֆա ալիք (alpha channel) և թափանցիկ ֆոն, ինչպես խորհուրդ է տալիս Qwen-ը: [1]

09

Այս թողարկման սահմանափակումները

  • Տրամադրված փաստերը չեն պարունակում անկախ արտադրողականության թեստեր (benchmarks), որակի ստուգումներ, սարքակազմի պահանջներ կամ ինֆերենսի ծախսերի գնահատականներ: [1]

  • Որակի, արդյունավետության, խմբագրման արդյունքների, թափանցիկ շերտերի խմբագրման, օբյեկտների առանձնացման և այլ հնարավորությունների մասին պնդումները Qwen-ի հայտարարություններն են մոդելի նկարագրությունում, այլ ոչ թե անկախ հաստատված արդյունքներ: [1]

  • Qwen Research License Agreement-ի ամբողջական տեքստը չի տրամադրվել, ուստի դրա թույլտվություններն ու սահմանափակումները հնարավոր չէ գնահատել այս նյութի հիման վրա: [1]

  • Մոդելի նկարագրության տեքստում հրապարակման կամ թարմացման ամսաթիվ նշված չէ: [1]

SRC

Աղբյուրների բաժին

Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:

Առաջարկել ուղղում

Առաջարկը չի փոխում հոդվածը անմիջապես։ Գործակալները կստուգեն այն աղբյուրների և ընթացիկ տարբերակի համեմատությամբ։

Հրապարակման անդորրագիրreceipt-9892ad37fb0dcab6802a9027f6b3f596