Նախատպությունն առանձնացնում է prompt-երի բազմազանությունը և օպտիմիզացման արագությունը լեզվական մոդելների distillation-ում
arXiv-ի նոր նախատպության հեղինակները նշում են, որ բազմազան հարցումները կարող են արագ ծածկել լրիվ տվյալներով on-policy distillation-ի բազմաթիվ rollout վիճակներ, մինչդեռ ուսուցչին համապատասխանեցումը դեռ պահանջում է հարյուրավոր քայլեր։ Արդյունքները հուշում են, որ տվյալների բազմազանությունն ու վիճակների հասանելիությունը կարող են տարբերվել դրանք յուրացնելու օպտիմիզացիոն աշխատանքից, սակայն պնդումը նախնական է և վերարտադրման կարիք ունի։
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ի նոր նախատպությունն ուսումնասիրում է լեզվական մոդելների on-policy distillation-ը նվազագույն տվյալների պայմաններում։ Հեղինակները նշում են, որ տարբերվող հարցումների փոքր խումբը կարող է ապահովել rollout վիճակների վերահսկողության (supervision) մեծ մասը, որը նկատվում է ամբողջական տվյալներով ուսուցման ժամանակ, սակայն այդ վերահսկողությունը յուրացնելու համար միևնույն է պահանջվում են հարյուրավոր օպտիմիզացման քայլեր [1]։
01
Ինչ գիտենք այս պահին
- 01
[1] arXiv, «Rethinking On-Policy Distillation of Large Language Models II: One Training Example», տարբերակ 1, ներկայացված՝ 2026 թ. սեպտեմբերի 3-ին։ https://arxiv.org/abs/2609.04172v1
- 02
Հիմնական հասանելի աղբյուրը arXiv-ի գրանցումն ու սեղմագիրն են. այն նախատպություն է և անկախ ստուգում չի անցել։
02
Վիճակների ծածկույթը մեկ ուսուցողական հարցման դեպքում
Հեղինակների տվյալներով՝ մեկ հարցումն ընդգրկել է լրիվ տվյալներով on-policy distillation-ի վիճակների 71.5%-ը՝ հիմնականում առաջին 100 քայլում։Վիճակների ծածկույթը 16 տարբեր հարցումների դեպքում
Ըստ հեղինակների՝ իմաստային առումով 16 տարբեր հարցումներն ապահովել են 98.9% ծածկույթ և հավասարվել ամբողջական ուսուցմանը։Ուսուցչին համապատասխանեցման ժամանակացույցը
Հեղինակների դիտարկմամբ՝ ուսուցչին համապատասխանեցումը շարունակել է պահանջել հարյուրավոր քայլեր՝ նույնիսկ ֆիքսված վիճակների պարագայում։Բոլոր ցուցանիշները մեկ arXiv նախատպության հեղինակների արդյունքներն են, ոչ թե անկախ ստուգման տվյալներ։
03
Ինչ է ուսումնասիրում նախատպությունը
«Rethinking On-Policy Distillation of Large Language Models II: One Training Example» վերնագրով հոդվածը հրապարակվել է arXiv-ում՝ Արհեստական բանականության և Համակարգչային լեզվաբանության բաժիններում։ Հեղինակներն ուսումնասիրում են, թե ինչպես են ուսուցման հարցումները (queries) ազդում on-policy distillation-ի վրա՝ փորձարկելով մեկ հարցմամբ ուսուցումը [1]։
- On-policy distillation-ն օգտագործում է ուսանող-մոդելի գեներացրած rollout-ները՝ զուգորդված ուսուցիչ-մոդելի տոկենային մակարդակի խիտ վերահսկողությամբ։
- Աշխատանքում վիճակների ծածկույթը սահմանվում է որպես այն վիճակների մասնաբաժինը, որոնց հասնում է տվյալ հարցումների խումբը՝ ամբողջական տվյալներով distillation-ի համեմատ։
04
Ինչ են ներկայացնում հեղինակները
Ըստ հեղինակների փորձերի՝ մեկ ուսուցողական հարցումն ապահովել է ամբողջական տվյալների կիրառմամբ ստացված առաջընթացի մեծ մասը և հասել rollout վիճակների 71.5%-ին։ Իմաստային առումով տարբերվող հարցումների ավելացումը մեծացրել է թե՛ վիճակների ծածկույթը, թե՛ վալիդացիայի ճշգրտությունը. 16 հարցման դեպքում նրանք գրանցել են 98.9% ծածկույթ և իրենց գնահատած միջավայրերում ամբողջական տվյալներով ուսուցմանը համարժեք արդյունք [1]։
Նույն սեղմագրում արվում է մեկ այլ եզրակացություն օպտիմիզացման վերաբերյալ. ուսանող-մոդելի համապատասխանեցումն ուսուցչին դանդաղել է նույն տեմպով՝ ինչպես մեկ հարցման, այնպես էլ ամբողջական բազայի դեպքում։ Հեղինակները նշում են, որ rollout-ների հասանելիությունը կարող է ձևավորվել արագ, սակայն այդ վերահսկողությունից սովորելը պահանջում է բազմաթիվ քայլեր։ Սա հեղինակների մեկնաբանությունն է, ոչ թե անկախ հաստատված փաստ [1]։
- Մեկ հարցում. գրանցվել է վիճակների 71.5% ծածկույթ, որը հիմնականում ձևավորվել է առաջին 100 քայլի ընթացքում։
- Տասնվեց իմաստային առումով տարբեր հարցում. գրանցվել է 98.9% ծածկույթ, որը փորձարկված միջավայրերում հավասարվել է ամբողջական տվյալներով ուսուցմանը։
- Ուսուցչին համապատասխանեցում (alignment). գործընթացը տևել է հարյուրավոր քայլեր՝ նույնիսկ ֆիքսված վիճակների դեպքում։
05
Ինչպես հասկանալ ստացված արդյունքը
Հիմնական հետևությունն այն է, որ ուսուցման երկու գործոն պետք է գնահատել առանձին. արդյոք prompt-երի խումբը հասնում է rollout վիճակների լայն շրջանակի, և որքանով է արդյունավետ ուսանող-մոդելը յուրացնում ուսուցչի վերահսկողությունը դրանց հասնելուց հետո։ Հեղինակները նաև նշում են բազմաուսուցիչ distillation-ի, թեթև շաբլոնների և WildChat-ի այլ տիրույթի հարցումների փորձարկումների մասին, սակայն սեղմագիրը բավարար մանրամասներ չի պարունակում այդ համեմատությունները լիարժեք գնահատելու համար [1]։
Արհեստական բանականության ոլորտին հետևողների համար սա մեթոդաբանական նշանակություն ունի. փորձերը, որոնք փոխում են միայն տվյալների ծավալը, կարող են անտեսել հարցումների բազմազանության և rollout ծածկույթի դերը։ Նախատպությունը դեռևս չի ապացուցում արդյունքների համընդհանուր վերարտադրելիությունը, իսկ տվյալները չեն առաջարկում ուսուցման պատրաստի բաղադրատոմս։ Սկզբնաղբյուրը հասանելի է arXiv-ում [1]։
- Prompt-երի բազմազանությունը կարող է ավելի կարևոր լինել rollout վիճակներն ընդգրկելու համար, քան prompt-երի պարզ քանակը։
- Վիճակների բարձր ծածկույթն ինքնին չի նշանակում, որ մոդելն արագ կյուրացնի այդ վիճակները։
- Արդյունքը վարկած է հետագա փորձարկումների համար, այլ ոչ թե ապացույց, որ ամբողջական տվյալների բազաներն ընդհանրապես պետք չեն։
06
Ինչ կարող են հետազոտողները ստուգել հաջորդիվ
Հոդվածն առաջարկում է ստուգելի հետազոտական վարկած, այլ ոչ թե գործառնական հանձնարարական։
- 01
Համեմատել prompt-երի հավաքածուներն ըստ իմաստային բազմազանության և rollout վիճակների չափված ծածկույթի, այլ ոչ թե միայն prompt-երի քանակի։
- 02
Չափել՝ արդյոք օպտիմիզացման լրացուցիչ քայլերը բարելավում են համապատասխանեցումը (alignment) ուսուցիչ-մոդելին այն բանից հետո, երբ rollout-ների ծածկույթի աճը կանգ է առել։
- 03
Փորձերը կրկնելուց առաջ գտնել հոդվածի մեթոդաբանության ամբողջական նկարագրությունն ու թողարկված նյութերը. տրամադրված աղբյուրում բաց կոդի, տվյալների բազաների, checkpoint-ների կամ կարգավորումների առկայությունը հաստատված չէ։
07
Այս թողարկման սահմանափակումները
Սա arXiv նախատպության 1-ին տարբերակն է՝ ներկայացված 2026 թ. սեպտեմբերի 3-ին։ Տրամադրված նյութերում գրախոսման կամ անկախ վերարտադրման արդյունքներ չկան [1]։
Հասանելի տվյալներում նշված չեն առաջադրանքների հստակ տիրույթները, մոդելների ընտանիքները, վալիդացիայի չափանիշները, վիճակագրական վերլուծությունը կամ ազդեցության չափերը [1]։
Տրամադրված տեղեկատվությունը ցույց չի տալիս՝ արդյոք արդյունքները կիրառելի են հեղինակների փորձարկած մոդելներից, առաջադրանքներից, ուսուցիչներից կամ ուսուցման միջավայրից դուրս [1]։
Նյութերում չի հաստատվում կոդի, տվյալների հավաքածուների, մոդելի checkpoint-ների կամ փորձերի մանրամասն պարամետրերի հանրային հասանելիությունը [1]։
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


