Պրեպրինտը հայտնում է մոդելի և harness-ի անհամապատասխանության մասին ամբողջական հետագծի նմանակման ժամանակ
Հեղինակները հայտնում են, որ փորձագետի ամբողջական հետագծի նմանակումը վնասել է թույլ մոդելներին, երբ կիրառվել է հենց այդ մոդելների շուրջ զարգացված harness-ների հետ, մինչդեռ թույլ մոդելի սեփական rollout-ում միայն ձախողված քայլն ուղղող մեթոդը կարող է պահպանել մոդելի և harness-ի համապատասխանությունը։ Պնդումները մնում են չգրախոսված և տրամադրված աղբյուրում չունեն առաջադրանքների մակարդակով ու վերարտադրելիության մանրամասներ։ [1]
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ում ներկայացված նոր պրեպրինտի համաձայն՝ ավելի թույլ AI մոդելի fine-tuning-ը ավելի հզոր մոդելի ամբողջական առաջադրանքային հետագծերի վրա կարող է նվազեցնել արդյունավետությունը, երբ գործակալային harness-ը նախապես զարգացվել է հենց թույլ մոդելի շուրջ։ Հեղինակներն առաջարկում են քայլի մակարդակով (turn-level) փորձագիտական ուղղման ավելի նեղ մոտեցում, սակայն տրամադրված նյութը չի պարունակում անկախ ստուգում կամ վերարտադրելիության տվյալներ։ [1]
01
Ինչ գիտենք այս պահին
- 01
[1] «Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails» աշխատանքի arXiv գրառումը և ամփոփագիրը՝ https://arxiv.org/abs/2609.09134v1 (ներկայացվել է 2026 թ. սեպտեմբերի 8-ին, առաջնային աղբյուր, պրեպրինտ)։ [1]
- 02
Հեղինակները ներկայացնում են յոթ կորպորատիվ գործակալային առաջադրանքների արդյունքներ, այդ թվում՝ զարգացված harness-ի պայմաններում փորձագետի ամբողջական հետագծով fine-tuning-ից հետո 4-30 միավորի անկում, և նկարագրում են turn-level on-policy ուղղման ընթացակարգ։ [1]
02
Հետազոտության միջավայրը՝ ըստ հեղինակների
Ամփոփագրում նկարագրվում են կորպորատիվ գործակալային առաջադրանքներ և թեստեր Qwen3-Coder-ի ու Gemma 4-ի մասնակցությամբ։Գրանցված անկումը լիարժեք նմանակումից հետո
Զարգացված harness-ի պայմաններում հեղինակները հայտնում են 4-30 միավորի անկման մասին բոլոր փորձարկված առաջադրանքներում։Առաջարկվող միջամտությունը
Փորձագետը վերաշարադրում է միայն թույլ մոդելի rollout-ում ձախողված քայլը՝ ամբողջական հետագիծ տրամադրելու փոխարեն։Սրանք հեղինակների հայտնած պրեպրինտային արդյունքներն են, ոչ թե անկախ ստուգված տվյալներ։ [1]
03
Ինչ է հայտնում պրեպրինտը
«Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails» վերնագրով աշխատանքը arXiv-ի Artificial Intelligence բաժնում ներկայացրել են Չժոու Յուն (Zhou Yu) և տասը համահեղինակներ։ arXiv-ի գրառումը հեղինակների հայտնած արդյունքների հիմնական աղբյուրն է։ [1]
Հիմնական զգուշացումը պայմանական է. ամբողջական հետագծի նմանակումը կարող է անվտանգ չհամադրվել ավելի թույլ մոդելին հարմարեցված scaffolding-ի հետ։ Տրամադրված նյութը բավարար մանրամասներ չի պարունակում՝ պարզելու, թե առաջադրանքների որ տեսակները, գնահատման չափանիշները կամ harness-ի առանձնահատկություններն են պայմանավորում նշված ազդեցությունը։ [1]
- Harness-ը նկարագրվում է որպես մոդելը շրջապատող prompt-երի, գործիքների, կատարման hook-երի և կոնտեքստի կառավարման scaffolding։
- Հեղինակները նշում են, որ նախ harness-ը զարգացրել են թույլ մոդելի միջոցով, ապա նկատել, որ ավելի հզոր փորձագետ մոդելն այդ harness-ն օգտագործում է ավելի արդյունավետ։
- Ըստ հեղինակների՝ զարգացված harness-ի պայմաններում թույլ մոդելը փորձագետի ամբողջական հետագծերով մարզելը հանգեցրել է արդյունավետության 4-30 միավորի անկման բոլոր յոթ կորպորատիվ առաջադրանքներում՝ ինչպես Qwen3-Coder-ի, այնպես էլ Gemma 4-ի դեպքում։ Միաժամանակ նշվում է, որ նույն մարզումն օգտակար է եղել չզարգացված harness-ի պարագայում։
04
Ինչու կարող են ձախողվել փորձագիտական ամբողջական ցուցադրումները
Աշխատանքը խնդիրը դիտարկում է որպես մոդելի կշիռների և scaffolding-ի փոխազդեցություն։ Harness-ը, որը ձևավորվել է մոդելի բնական պլանավորման վարքագծի շուրջ, կարող է այլևս չհամապատասխանել այն բանից հետո, երբ մոդելը մարզվում է ավելի հզոր փորձագետի մոտեցմանը հետևելու համար։ [1]
Այս մեկնաբանությունը չպետք է ընդհանրացվի նշված հետազոտության շրջանակից դուրս։ Տրամադրված տվյալները չեն պարունակում պատճառահետևանքային աբլյացիոն վերլուծություն կամ արտաքին գնահատումներ, որոնք կհաստատեին այս բացատրությունը այլ մոդելների կամ գործակալային համակարգերի համար։ [1]
- Հեղինակներն արդյունավետության անկումը վերագրում են մոդելի և harness-ի համապատասխանության խաթարմանը։
- Ըստ նրանց բացատրության՝ նմանակումը փոխանցում է որոշակի գիտելիք և ավելացնում scaffolding-ի օգտագործումը, սակայն թույլ մոդելը որդեգրում է փորձագետի պլանավորման ռազմավարությունը՝ առանց այն իրագործելու բավարար կարողության։
- Սա հեղինակների առաջարկած բացատրությունն է, ոչ թե անկախ կերպով հաստատված պատճառահետևանքային կապ։
05
Ուղղման ավելի նեղ մեթոդը
Հեղինակներն իրենց այլընտրանքն անվանում են on-policy expert-correction pipeline: Նրանք նշում են, որ մեթոդը պահպանում է թույլ մոդելի պլանավորման ոճը՝ այն հարմարեցնելով տեղայնորեն հայտնաբերված ձախողման կետում, և հայտնում են, որ այն համատեղում է harness-ի զարգացման ու մոդելի ադապտացիայի առավելությունները։ [1]
Ամփոփագրում չի հստակեցվում, թե ինչպես են հայտնաբերվում ձախողված քայլերը, ինչպես են ընտրվում կամ մարզվում ուղղումները, որ փորձագիտական մոդելն է օգտագործվում, կամ որոնք են հայտարարված համակցված ձեռքբերումների հիմքում ընկած համեմատական չափումները։ Այս բացթողումների պատճառով մեթոդը տվյալ աղբյուրից հնարավոր չէ գնահատել որպես վերարտադրելի բաղադրատոմս։ [1]
- Ելակետ ընդունել թույլ մոդելի սեփական rollout-ը։
- Գտնել ձախողված քայլը (turn) գործընթացի միջոցով, որը, ըստ հեղինակների, ավտոմատացված է մետա-մակարդակի MLE գործակալի կողմից։
- Փորձագետից պահանջել վերաշարադրել միայն այդ կոնկրետ քայլը՝ ամբողջական փոխարինող հետագիծ ստեղծելու փոխարեն։
06
Արդյունքի գործնական նշանակությունը
Գործակալային համակարգեր գնահատող թիմերի համար օգտակար հետևությունն այն է, որ մոդելը և դրա harness-ը պետք է չափվեն որպես փոխկապակցված համակարգ։ Հետազոտությունում նշված անկումը հուշում է, որ ավելի հզոր մոդելի ցուցադրումները կարող են փոխել թույլ մոդելը այնպիսի ձևերով, որոնք չեն համապատասխանում թույլ մոդելի սկզբնական վարքագծի համար օպտիմալացված միջավայրին։ [1]
Սա վարկած է և գնահատման նկատառում, այլ ոչ թե ապացուցված ընդհանուր կանոն։ Զեկուցված շրջանակը սահմանափակվում է չճշգրտված յոթ կորպորատիվ գործակալային առաջադրանքներով, իսկ առաջնային աղբյուրը տրամադրված փաթեթում չի պարունակում անկախ վերարտադրում, հանրային նյութեր կամ առաջադրանքների մակարդակով ապացույցներ։ [1]
- Մեկ scaffold-ի ներքո fine-tuning-ի հաջողված արդյունքը չդիտարկել որպես ապացույց, որ այն կաշխատի այլ կամ զարգացված scaffold-ի դեպքում։
- Գնահատել առաջադրանքի վերջնարդյունքները (end-to-end), այլ ոչ միայն նմանակման որակը կամ մոդելի կողմից գործիքների ու scaffold-ի բաղադրիչների օգտագործման հաճախականությունը։
- Զարգացված harness-ը փորձարկելիս ամբողջական հետագծի նմանակումը և տեղային ուղղումը պահել որպես առանձին փորձարարական պայմաններ։
07
Ինչ ստուգել մոտեցումը կիրառելուց առաջ
Պրեպրինտը ներկայացնում է գնահատման նեղ փորձառություն, ոչ թե պատրաստի կիրառելի ընթացակարգ։
- 01
Մոդելի fine-tuning-ը փորձարկել հենց այն harness-ի հետ, որի միջավայրում այն աշխատելու է, այլ ոչ թե ենթադրել, որ նախնական և զարգացված scaffolding-ի միջև արդյունքներն ինքնաբերաբար փոխանցվում են։
- 02
Համեմատել փորձագիտական ամբողջական հետագծի նմանակումը (imitation) այն միջամտությունների հետ, որոնք փոփոխում են միայն թույլ մոդելի սեփական աշխատանքային ընթացքում ի հայտ եկած ձախողված կետերը։
- 03
Զեկուցված ուղղման ընթացակարգը դիտարկել որպես հետազոտական վարկած, քանի դեռ հասանելի չեն առաջադրանքների սահմանումները, չափումները, իրականացման մանրամասներն ու անկախ արդյունքները։ [1]
08
Այս թողարկման սահմանափակումները
Սա arXiv պրեպրինտ է, որը ներկայացվել է 2026 թ. սեպտեմբերի 8-ին, այլ ոչ թե գրախոսված գիտական աղբյուր։ [1]
Տրամադրված նյութը չի նշում յոթ առաջադրանքները, դրանց չափանիշները, ելակետային ցուցանիշները, առաջադրանքների մակարդակով արդյունքները կամ իրականացման մանրամասները։ [1]
Տրամադրված աղբյուրում հաստատված չեն կոդի, տվյալների, checkpoint-ների, harness-ի կարգավորումների հասանելիությունը կամ անկախ վերարտադրումը։ [1]
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


