Նախատպագիրը հայտնում է Mixture-of-Experts մոդելներում կրկնվող տվյալներից արդյունավետության ավելի արագ անկման մասին
Չգրախոսված arXiv նախատպագիրը հայտնում է, որ հեղինակների փորձարկումներում MoE լեզվական մոդելներն ուսուցման տվյալների կրկնության նկատմամբ ավելի խոցելի են եղել, քան խիտ մոդելները: Հեղինակները նշում են, որ ռեգուլյարիզացիան մեղմել է ազդեցությունը, սակայն չի հավասարվել բացառապես եզակի տվյալներով ուսուցմանը: Արդյունքը պահանջում է ավելի լիարժեք մեթոդաբանական դիտարկում և անկախ վերարտադրում:
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ում ներկայացված նոր նախատպագրում նշվում է, որ հեղինակների փորձերում Mixture-of-Experts (MoE) լեզվական մոդելների արդյունավետությունն ավելի արագ է նվազել, քան խիտ մոդելներինը, երբ ուսուցման տվյալները բազմիցս կրկնվել են: Այս արդյունքը կարող է էական լինել նոսր ճարտարապետությունների գնահատման համար, երբ եզակի տեքստային տվյալները սահմանափակ են, սակայն այն հեղինակների ներկայացրած չգրախոսված եզրակացություն է, ոչ թե հաստատված ուղեցույց: [1]
01
Ինչ գիտենք այս պահին
- 01
[1] arXiv, «Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data», տարբերակ 1, ներկայացված 2026 թ. սեպտեմբերի 10-ին՝ https://arxiv.org/abs/2609.11917v1
- 02
Տրամադրված առաջնային գրառումը նախատպագրի գրանցում է, ոչ թե անկախ գնահատական:
02
Հետազոտության կարգավիճակը
arXiv-ը սա գրանցել է որպես 1 տարբերակի նախատպագիր: Տրամադրված նյութը չի հաստատում գրախոսման կամ անկախ ստուգման առկայությունը:Ներկայացված մոդելների շրջանակը
Հեղինակները ներկայացնում են խիտ և MoE փորձեր՝ 80M-ից մինչև 1B ակտիվ պարամետրերով, որտեղ MoE կարգավորումները հասնում են մինչև 8.5B ընդհանուր պարամետրի:MoE-ների համար նշված սկիզբը
Հեղինակները նշում են, որ իրենց փորձարկումներում MoE-ները սկսել են տուժել չորս կրկնությունից հետո: Սա գործառնական ընդհանուր սահմանափակում չէ:Նշված մեղմացումը
Հեղինակները հայտնում են, որ դիմակավորման վրա հիմնված ուժեղ ռեգուլյարիզացիան իրենց փորձերում նվազեցրել է խնդիրը, սակայն փորձարկված ոչ մի մեթոդ չի հավասարվել բացառապես եզակի տվյալներով ուսուցմանը:Արդյունավետության բոլոր դիտարկումները ներկայացված են նախատպագրի հեղինակների կողմից և սահմանափակված են նրանց փորձարարական պայմաններով: [1]
03
Ինչ է ներկայացվել
arXiv-ում գրանցված է «Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data» աշխատանքի 1 տարբերակը, որը ներկայացվել է 2026 թվականի սեպտեմբերի 10-ին: Նշված հեղինակներն են Ատինդրա Ջհան, Մարգարետ Լին, Յուրե Լեսկովեցը, Փերսի Լյանը և Լյուկ Զեթլմոյերը: Հոդվածը դասակարգված է «Machine Learning» և «Computation and Language» բաժիններում: [1]
Նախատպագիրն ուսումնասիրում է ուսուցման տվյալների կրկնությունը նոսր ակտիվացմամբ MoE լեզվական մոդելներում և դրանց արձանագրված վարքագիծը համեմատում խիտ մոդելների հետ: [1]
- Հեղինակները նշում են կրկնության տարբեր հաճախականությունների կիրառման մասին մեկ և մի քանի տիրույթներ ներառող տվյալների խառնուրդներում:
- Նրանք նաև հայտնում են MoE կարգավորումների փորձարկման մասին, ներառյալ փորձագետների քանակն ու մանրամասնության աստիճանը:
- Նրանց նշած մոդելների շրջանակը կազմել է 80M-ից մինչև 1B ակտիվ պարամետր՝ MoE կարգավորումներում հասնելով մինչև 8.5B ընդհանուր պարամետրի:
04
Հեղինակների ներկայացրած արդյունքները
Հոդվածի գլխավոր արձանագրված արդյունքն այն է, որ MoE մոդելներն ուսուցման տվյալների կրկնությանը զուգընթաց ավելի արագ են կորցրել արդյունավետությունը, քան խիտ մոդելները: Հեղինակները նշում են, որ այս ազդեցությունն աճել է նոսրությանը զուգահեռ և իրենց փորձերում պայմանավորված է եղել ընդհանուր, ոչ թե ակտիվ պարամետրերի քանակով: Այս եզրահանգումները սահմանափակված են նշված փորձարարական պայմաններով: [1]
Հեղինակները նաև նշում են, որ MoE երթուղավորումը կայունացել է ուսուցման վաղ փուլում, իսկ փորձագետների մասնագիտացումը փոխկապակցված է եղել բարձր կրկնության ռեժիմներում վերաուսուցման հետ: Սա հաստատում է նրանց փորձերում արձանագրված կոռելյացիան, այլ ոչ թե համընդհանուր պատճառահետևանքային բացատրություն: [1]
Դիմակավորման վրա հիմնված ուժեղ ռեգուլյարիզացիայի դեպքում հեղինակները հայտնում են, որ MoE-ները գերազանցել են խիտ մոդելներին նույնիսկ այն դեպքում, երբ տվյալները կրկնվել են ավելի քան 64 անգամ: Այդ արդյունքը չի նշանակում, որ մեղմացումը վերականգնել է բացառապես եզակի տվյալներով բազային մակարդակը, որին, ըստ հեղինակների, փորձարկված ոչ մի մեթոդ չի հասել: [1]
- Հեղինակները նշում են, որ իրենց փորձերում 80M խիտ մոդելը տվյալները կրկնել է ավելի քան ութ անգամ՝ նվազագույն վատթարացմամբ:
- Ըստ նրանց՝ MoE-ների աշխատանքը սկսել է տուժել չորս կրկնությունից հետո և փորձարկված համեմատությունում զիջել է խիտ մոդելներին 32 կրկնությունից հետո:
- Նրանք հայտնում են, որ dropout-ը և դիմակավորման վրա հիմնված ուժեղ ռեգուլյարիզացիան մեղմել են վերաուսուցումը, սակայն փորձարկված ոչ մի մեթոդ չի հավասարվել բացառապես եզակի տվյալներով ուսուցմանը:
05
Ինչ պետք է և ինչ չպետք է եզրակացնեն ընթերցողները
MoE ճարտարապետությունը և տվյալների վերօգտագործումը գնահատող հետազոտողների համար նախատպագիրը մատնանշում է հնարավոր փոխզիջում, որն արժե փորձարկել. հեղինակների համեմատություններում նոսր մոդելներն ավելի զգայուն են եղել ուսուցման տվյալների կրկնության նկատմամբ, քան խիտ մոդելները: Դա չի ապացուցում, որ յուրաքանչյուր MoE մոդել կամ համակարգ իրեն հենց այդպես կդրսևորի: [1]
Հիմնական փաստերը տրամադրված նյութերում դեռևս անհասանելի են, ներառյալ փորձարարական ամբողջական տվյալների բազան և բենչմարկերի համատեքստը, ուսուցման բյուջեները և վիճակագրական վերլուծությունը: Տրամադրված նյութը չի պարունակում նաև անկախ վերարտադրման արդյունքներ կամ արտաքին գնահատական: Այդ բացերը սահմանափակում են վերարտադրելիության և ավելի լայն կիրառելիության մասին հետևությունները: [1]
- Աշխատանքն օգտագործեք տվյալների կրկնության և նոսրության փորձարկումներ ձևակերպելու, այլ ոչ թե կրկնության հաստատուն շեմ սահմանելու համար:
- Հնարավորության դեպքում մեղմացման մոտեցումները համեմատեք բացառապես եզակի տվյալներով բազային մակարդակի հետ:
- Առանց լրացուցիչ փաստերի մի ենթադրեք, որ նշված մասշտաբի արդյունքները տարածվում են ավելի մեծ մոդելների կամ պրոդաքշն համակարգերի վրա:
06
Առաջնային աղբյուր
Առաջնային աղբյուրը հեղինակների arXiv գրառումն ու նախատպագիրն են: Դա հեղինակների ամփոփագրին, նշված մեթոդներին և արդյունքներին ծանոթանալու համապատասխան հղումն է: [1]
- Առաջնային աղբյուր՝ https://arxiv.org/abs/2609.11917v1
- Տարբերակ՝ arXiv:2609.11917v1
- Գրանցված ներկայացման ամսաթիվ՝ 2026 թվականի սեպտեմբերի 10
07
Ինչպես հասկանալ այս արդյունքը
Հոդվածը դիտարկեք որպես փորձարարական ազդակ՝ նոսր մոդելների նախագծման, տվյալների վերօգտագործման և ռեգուլյարիզացիայի գնահատման համար, այլ ոչ թե ուսուցման համընդհանուր կանոն:
- 01
Նշված 4x, 8x կամ 32x կրկնության կետերը մի կիրառեք որպես համընդհանուր սահմանափակումներ այլ մոդելների կամ ուսուցման գործընթացների համար:
- 02
Եզրակացություններ անելուց առաջ տվյալների վերօգտագործման ցանկացած առաջարկվող կարգավորում համեմատեք հոդվածի մոդելի մասշտաբի, կրկնության ռեժիմի և ռեգուլյարիզացիայի պայմանների հետ:
- 03
Ուսուցման քաղաքականությունը փոխելուց առաջ ծանոթացեք առաջնային նախատպագրին և հետևեք անկախ վերարտադրման արդյունքներին:
08
Այս թողարկման սահմանափակումները
Տրամադրված տվյալները հաստատում են arXiv-ում 1 տարբերակի ներկայացումը, ոչ թե գիտական գրախոսումը, անկախ ստուգումը կամ առանձին հրապարակման ամսաթիվը: [1]
Տրամադրված փաստերը չեն պարունակում տվյալների ամբողջական բազայի, ուսուցման բյուջեի, բենչմարկերի կամ վիճակագրական վերլուծության մանրամասները, որոնք անհրաժեշտ են վերարտադրելիությունն ու հուսալիությունը գնահատելու համար: [1]
Ներկայացված MoE փորձերը հասել են մինչև 8.5B ընդհանուր պարամետրի: Տվյալները ցույց չեն տալիս, թե արդյոք արդյունքները վերաբերում են ավելի մեծ մոդելներին կամ պրոդաքշն համակարգերին: [1]
Անկախ վերարտադրման արդյունքներ, գրախոսված համեմատություններ կամ արտաքին գնահատականներ չեն տրամադրվել: [1]
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


