Պրեպրինտում համեմատվում են օժանդակ տեսադաշտերն ու փաստաթղթերի կրկնությունը LLM-ների ուսուցման մեջ
Հեղինակները հայտնում են, որ իրենց վերահսկվող փորձերում ֆիքսված թոքենային բյուջեի պայմաններում օժանդակ տեսադաշտերը՝ գիտելիքի վերաձևակերպումները, բարելավել են ուսուցումը՝ փաստաթղթերի հավելյալ կրկնության համեմատ: Սա պրեպրինտի կոնկրետ արդյունք է, ոչ թե ապացույց, որ բազմազան կամ սինթետիկ տվյալները միշտ ավելի լավն են: Մասշտաբի, մեթոդների, ծախսերի և վերարտադրելիության վերաբերյալ կարևոր մանրամասները բացակայում են ներկայացված համառոտագրից: [1]
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

2026 թվականի arXiv-ի պրեպրինտում նշվում է, որ մեծ լեզվական մոդելների (LLM) նախնական ուսուցման վերահսկվող փորձարկումների ընթացքում ֆիքսված թոքենային բյուջեի մի մասը գիտելիքի բազմազան վերաձևակերպումներին՝ այսպես կոչված օժանդակ տեսադաշտերին (auxiliary views) հատկացնելը բարելավել է ուսուցման արդյունավետությունը՝ փաստաթղթերի հավելյալ կրկնության համեմատ: Արդյունքը ներառում է փաստացի վերհիշումը հեղինակների փորձարկած պայմաններում, սակայն ներկայացված համառոտագրում բացակայում են այն մեթոդներն ու չափումները, որոնք անհրաժեշտ են էֆեկտի չափը, շրջանակը, ծախսատարությունը կամ վերարտադրելիությունը գնահատելու համար: [1]
01
Ինչ գիտենք այս պահին
- 01
[1] arXiv, «Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views», տարբերակ 1, ներկայացված է 2026 թ. սեպտեմբերի 3-ին՝ https://arxiv.org/abs/2609.04180v1:
- 02
[1] Հասանելի առաջնային ապացույցը arXiv-ի համառոտագրի էջն է. այն արձանագրում է հեղինակների պնդումները, սակայն այս փաթեթում չի տրամադրում փորձարարական ամբողջական մանրամասները:
02
Ապացույցի տեսակը
Հասանելի հիմնական նյութը arXiv-ի 1 տարբերակի համառոտագիրն է, ոչ թե մեթոդաբանության ամբողջական վերլուծությունը:Համեմատված տարբերակներ
Հեղինակները նշում են ֆիքսված թոքենների բյուջեն փաստաթղթերի կրկնությունից դեպի օժանդակ տեսադաշտեր վերաբաշխելու մասին:Վերաձևակերպման պայմանը
Հեղինակների փորձերում վերաձևակերպումն օգնել է միայն փոքր փաթեթների (batch size) դեպքում:Անկախ կրկնօրինակում
Անկախ կրկնօրինակում կամ արտաքին գնահատում չի տրամադրվել:Գրաֆիկն արտացոլում է arXiv-ի ներկայացված գրառման շրջանակը, ոչ թե մոդելների ուսուցման համընդհանուր կանոն:
03
Փորձերով հիմնավորված նեղ պնդումը
Հոդվածում նկարագրված համեմատությունը պարզապես «ավելի շատ տվյալն ավելի լավ է» մոտեցումը չէ: Այն վերաբերում է նրան, թե ինչպես է բաշխվում ուսուցման թոքենների ֆիքսված քանակը՝ փաստաթղթերի հետագա կրկնությա՞ն, թե՞ միևնույն գիտելիքի լրացուցիչ ներկայացումների միջև: Համառոտագրի հիման վրա հեղինակների ապացույցները պաշտպանում են սահմանափակ այն պնդումը, որ օժանդակ տեսադաշտերն ավելի լավ արդյունք են ցույց տվել իրենց փորձարարական միջավայրում: [1]
Սա չի նշանակում, որ տվյալների բազմազանության ցանկացած ձև, սինթետիկ վերաշարադրում կամ վերաձևակերպում կբարելավի յուրաքանչյուր մոդել կամ նախնական ուսուցման կորպուս: Համառոտագրում հստակեցված չեն փորձարկված մոդելները, տվյալները, առաջադրանքների սահմանումները կամ արձանագրված բարելավման իրական չափը: [1]
- Հեղինակները օժանդակ տեսադաշտերը բնորոշում են որպես գիտելիքի վերաձևակերպումներ:
- Նրանք հայտնում են վերահսկվող փորձարկումների մասին, որոնք նպատակ ունեն առանձնացնել դրանց ազդեցությունը նախնական ուսուցման ժամանակ:
- Թոքենների ֆիքսված բյուջեի պայմաններում, ըստ նրանց, թոքենները կրկնվող փաստաթղթերից դեպի օժանդակ տեսադաշտեր տեղափոխելը բարելավել է ուսուցումը, այդ թվում՝ փաստացի վերհիշումը իրենց փորձարկած միջավայրերում:
04
Հարակից բացահայտումներ և կարևոր սահմանափակումներ
Համառոտագրում ներկայացված են մի շարք լրացուցիչ դիտարկումներ, սակայն դրանցից յուրաքանչյուրը մնում է որպես պրեպրինտի հեղինակների կողմից ներկայացված արդյունք: Մասնավորապես, այն հիմք չի տալիս ամբողջությամբ հրաժարվել կրկնությունից. հեղինակները հստակ նշում են, որ իրենց փորձերում յուրացման համար կրկնությունն անհրաժեշտ է եղել: [1]
Նմանապես, վերաձևակերպման արդյունքը պայմանական է, ոչ թե ընդհանրական: Հեղինակները նշում են, որ այն օգնել է փոքր փաթեթների դեպքում, մինչդեռ տրամադրված նյութերում բացակայում են փաթեթների կոնկրետ թվային արժեքները, վիճակագրական վերլուծությունը կամ խափանման դեպքերը: Համառոտագիրը նաև օժանդակ տեսադաշտերի արդյունավետությունը չի վերագրում որևէ կոնկրետ հզոր ուսուցիչ մոդելի կամ որակի որոշակի շեմի, սակայն առկա գրառումը չի բացահայտում, թե ինչպես է իրականացվել այդ համեմատությունը: [1]
- Հեղինակները նշում են, որ իրենց փորձերում յուրացման համար կրկնությունն անհրաժեշտ է եղել:
- Նրանք հայտնում են, որ վերաձևակերպումն օգնել է միայն փոքր փաթեթների (batch sizes) դեպքում:
- Նրանք ընդգծում են, որ օժանդակ տեսադաշտերի օգտակարությունը կախված չի եղել դրանք գեներացնող ուսուցիչ մոդելի (teacher model) հզորությունից:
- Նրանք նաև հայտնում են նախնական գիտելիքների բացերի պայմաններում կոնտեքստային ու հիմնարար գիտելիքների, ինչպես նաև ըստ շերտերի շեղումների ու սեղմման ուսումնասիրության մասին:
05
Կարգավիճակը և սկզբնաղբյուրը
arXiv-ում աշխատանքը գրանցված է որպես «Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views» վերնագրով պրեպրինտ: Գրառման մեջ նշված է 1 տարբերակի ներկայացման ամսաթիվը՝ 2026 թվականի սեպտեմբերի 3, ինչպես նաև մեկնաբանություն այն մասին, որ այն ընդունվել է Findings of EMNLP 2026-ում: Տրամադրված նյութը չի պարունակում գիտաժողովի նյութերի տարբերակը, գրախոսության պատմությունը կամ ինստիտուցիոնալ պատկանելությունը: [1]
Ուսուցման մոդելների նախագծման հետևանքները գնահատող ընթերցողների համար առաջնային աղբյուրը վերը նշված arXiv-ի գրառումն է: Դրա համառոտագիրը բավարար է հոդվածում նշված հիպոթեզն ու ընդհանուր արդյունքները հասկանալու համար, սակայն բավարար չէ ներդրման որոշումները հաստատելու կամ գործնական փոխզիջումները գնահատելու համար: [1]
- arXiv է ներկայացվել որպես 1 տարբերակ՝ 2026 թվականի սեպտեմբերի 3-ին:
- Նշված հեղինակներն են՝ Ջոզեֆ Լին, Իդի Հուանգը, Դոկյուն Կիմը, Շու Յանգը և Լի Շենը:
- arXiv-ի գրառման մեկնաբանություններում նշված է. ընդունված է Findings of EMNLP 2026-ում:
- Հիմնական աղբյուրը՝ https://arxiv.org/abs/2609.04180v1
06
Ինչպես դիտարկել այս արդյունքը
Պրեպրինտը պետք է դիտարկել որպես նեղ հիպոթեզ և փորձարարական արդյունք, ոչ թե ուսուցման բոլոր գործընթացների համար ընդհանրական կանոն:
- 01
Ֆիքսված թոքենային բյուջեով կորպուսների կառուցվածքը համեմատելիս անհրաժեշտ է տարբերակել փաստաթղթի կրկնօրինակները միևնույն գիտելիքի նպատակաուղղված ձևափոխված տարբերակներից:
- 02
Հակիրճ նկարագրությունից (abstract) չպետք է կանխատեսել սպասվող շահույթը, ծախսերը կամ փաթեթի չափի (batch size) կարգավորումները, քանի որ տրամադրված նյութը չի պարունակում տվյալներ ազդեցության չափի, մոդելի մանրամասների, տվյալների բազաների, չափանիշների կամ գեներացման ծախսերի մասին:
- 03
Արդյունքները կիրառելուց առաջ ծանոթացեք հոդվածի ամբողջական տեքստին և գիտաժողովի հետագա տարբերակներին: Ներկայացված նյութերը չեն հաստատում, թե արդյոք Findings of EMNLP 2026 տարբերակը տարբերվում է arXiv v1-ից:
07
Այս թողարկման սահմանափակումները
Տրամադրված է միայն arXiv-ի համառոտագրի էջը. փաթեթում բացակայում են փորձարարական ամբողջական մեթոդները, տվյալների բազաները, մոդելների կոնֆիգուրացիաները, չափանիշները, ընտրանքի ծավալները, փաթեթների չափերի միջակայքերը և ազդեցության չափերը:
Ներկայացված գրառման մեջ առկա չեն ծրագրային կոդ, տվյալներ, checkpoints, մանրամասն կարգավորումներ, հաշվարկային ծախսեր կամ օժանդակ տեսադաշտերի ստեղծման ծախսեր:
Անկախ կրկնօրինակում կամ արտաքին գնահատում չի տրամադրվել:
arXiv-ի գրառման մեջ նշվում է Findings of EMNLP 2026-ում ընդունվելու մասին, սակայն փաթեթը չի ներառում գիտաժողովի նյութերի էջը և չի հաստատում, թե արդյոք այդ տարբերակը տարբերվում է arXiv v1-ից:
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


