AutoCompact պրեպրինտը ներկայացնում է ծրագրավորման գործակալների կոնտեքստի կառավարման ուսուցման մեթոդ
AutoCompact-ը arXiv-ում գրանցված նոր պրեպրինտ է, որն առաջարկում է ուսուցանել կոնտեքստի սեղմման որոշումների կայացումը ծրագրավորման գործակալների համար։ Հեղինակները հայտնում են բազային մոդելի համեմատ բենչմարքային արդյունքների բարելավման մասին, սակայն ներկայացված աբստրակտը չի ապացուցում գրախոսման առկայությունը, անկախ վերարտադրելիությունը, վիճակագրական հավաստիությունը կամ լայն ընդհանրացումը։
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

AutoCompact-ը arXiv-ում հրապարակված պրեպրինտ է, որն առաջարկում է ծրագրավորման երկարատև առաջադրանքներ կատարող գործակալներին (coding agents) սովորեցնել՝ երբ սեղմել կոնտեքստը, աշխատանքային որ վիճակը պահպանել և ինչպես շարունակել գործընթացը։ Հեղինակները հայտնում են բազային մոդելի համեմատ բենչմարքային արդյունքների բարելավման մասին, սակայն ներկայացված նյութը սահմանափակվում է միայն աբստրակտով և չի ապացուցում գրախոսման առկայությունը, վերարտադրելիությունը կամ արդյունքների ընդհանրացումը։ [1]
01
Ինչ գիտենք այս պահին
- 01
arXiv-ը գրանցել է AutoCompact-ը որպես 1 տարբերակ՝ ներկայացված 2026 թ. հոկտեմբերի 1-ին։ [1]
- 02
Հեղինակները նկարագրում են ուսուցանված ռազմավարություն (policy)՝ կոնտեքստի սեղմման ճիշտ պահը որոշելու, աշխատանքային վիճակը պահպանելու և դրանից հետո գործընթացը շարունակելու համար։ [1]
- 03
Հեղինակները նշում են բազային մոդելի համեմատ SWE-bench Verified-ում 9.2 տոկոսային կետով, իսկ SWE-PolyBench Verified-ում 5.0 տոկոսային կետով բացարձակ բարելավման մասին։ [1]
02
Պրեպրինտի կարգավիճակը
Աշխատանքը գրանցված է որպես arXiv-ի 1 տարբերակ՝ ներկայացված 2026 թ. հոկտեմբերի 1-ին։ Գրախոսման առկայությունը հաստատված չէ։SWE-bench Verified-ի արդյունքները
Հեղինակները հայտնում են բազային մոդելի համեմատ առաջադրանքների հանձնման բացարձակ ցուցանիշի բարելավման մասին. աբստրակտում բազային ցուցանիշները նշված չեն։SWE-PolyBench Verified-ի արդյունքները
Հեղինակները նշում են բազային մոդելի համեմատ բացարձակ ցուցանիշի աճ. աբստրակտում առաջադրանքների քանակը, վարիացիան կամ անկախ վերարտադրելիությունը նշված չեն։Գնահատված կոնտեքստի պարամետրերը
Հեղինակները նկարագրում են 256K կոնտեքստի ռեժիմը (առանց գերազանցման) և 16K ռեժիմը, որտեղ գերազանցումը գործարկում է պահուստային սեղմում։Ներկայացված արդյունքներն ու փորձարկման պայմանները հիմնված են պրեպրինտի հեղինակների պնդումների վրա և անկախ ստուգում չեն անցել։ [1]
03
Հեղինակների նկարագրած մեթոդը
Ծրագրավորման երկարատև առաջադրանքները կարող են ներառել ուսումնասիրություն, որոնում, խմբագրում և թեստավորում երկար տրեկտորիաների ընթացքում: AutoCompact-ը նախատեսված է որոշելու այն պահը, երբ նախկին տեղեկատվությունը դառնում է պակաս պիտանի, այլ ոչ թե սեղմումը դիտարկելու որպես միայն կոնտեքստի սպառմանը տրվող արձագանք: Սրանք հեղինակների նախագծային պնդումներն են. ներկայացված աբստրակտը չի բացատրում գնահատող համակարգի կառուցվածքը, ուղղման կանոնները կամ ուսուցման ամբողջական արձանագրությունը: [1]
- Պրեպրինտը կոնտեքստի կառավարումը դիտարկում է որպես որոշումների հաջորդականություն՝ երբ սեղմել կոնտեքստը, որ վիճակը պահպանել և ինչպես շարունակել սեղմումից հետո։
- Հեղինակների խոսքով՝ գործակալն ուսուցանվում է կայացնել այդ ընտրությունները՝ որպես ռեպոզիտորիայի մակարդակով ծրագրային ապահովման ճարտարագիտական առաջադրանքներ լուծելու իր ռազմավարության (policy) մաս։
- Տվյալների հավաքագրման համար, ըստ հեղինակների, գնահատող համակարգը (judge) դիտարկում է սեղմման որոշումները, ամփոփագրերն ու դրան հաջորդող գործողությունները։ Սխալ համարված ելքերը փոխարինվում են ուղղված տարբերակներով՝ նախքան տրեկտորիայի շարունակվելը։
- Հեղինակները նշում են, որ այս տրեկտորիաներն օգտագործվում են նախ վերահսկվող ճշգրտման (supervised fine-tuning), ապա՝ առաջադրանքի հաջողության պարգևատրումների միջոցով կոդավորման և սեղմման համատեղ ամրապնդմամբ ուսուցման (reinforcement learning) համար։
04
Ինչ են ցույց տալիս և ինչ չեն ցույց տալիս հաղորդված արդյունքները
Ներկայացված թվերը հիմնավորում են միայն նեղ եզրակացություն. հեղինակների գնահատած պայմաններում մեթոդը գերազանցել է նշված բազային մոդելին այդ երկու բենչմարքերում՝ արձանագրված բացարձակ տարբերությամբ: Միայն տրամադրված տվյալների հիման վրա հնարավոր չէ պարզել ելակետային ցուցանիշների մեծությունը, գնահատված առաջադրանքների քանակը, արդյունքների վարիացիան, վիճակագրական նշանակալիությունը կամ այն, թե արդյոք մեթոդը նույն կերպ կաշխատի այլ մոդելի, գործակալի կամ կոնտեքստի կառավարման այլ տեխնիկայի դեպքում: [1]
- SWE-bench Verified-ում հեղինակները նշում են բազային մոդելի համեմատ առաջադրանքների հանձնման բացարձակ ցուցանիշի 9.2 տոկոսային կետով բարելավման մասին։
- SWE-PolyBench Verified-ում նրանք նշում են բազային մոդելի համեմատ բացարձակ ցուցանիշի 5.0 տոկոսային կետով բարելավման մասին։
- Ըստ նրանց՝ բարելավումները պահպանվել են գնահատված ինֆերենսի բոլոր ռեսուրսային սահմանաչափերում (inference budgets)։
- Աբստրակտը նկարագրում է 256K կոնտեքստային պատուհանի ռեժիմը, որը երբեք չի գերազանցվել, և 16K ռեժիմը, որտեղ գերազանցումը գործարկել է պահուստային սեղմում (fallback compaction)։
05
Կարգավիճակն ու սկզբնաղբյուրը
arXiv-ը աշխատանքը գրանցել է որպես պրեպրինտ։ Դա հաստատում է հրապարակման փաստն ու հեղինակների նախնական պնդումները, սակայն ոչ արտաքին գնահատումը։ Առաջնային աղբյուրը հասանելի է https://arxiv.org/abs/2610.02163v1 հասցեով։ [1]
- arXiv-ի գրառման մեջ աշխատանքի վերնագիրը նշված է որպես «AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents»:
- Որպես հեղինակներ նշված են Սյուան Չժանը (Xuan Zhang), Լունտաո Չժենը (Longtao Zheng), Ցունսյաո Դուն (Cunxiao Du), Բո Անը (Bo An) և Սին Դոնը (Xin Dong):
- Գրառումը ներկայացված է որպես 1 տարբերակ՝ 2026 թ. հոկտեմբերի 1-ի ներկայացման ամսաթվով։
06
Ինչպես մեկնաբանել արդյունքները
AutoCompact-ը հարկավոր է դիտարկել որպես նոր հրապարակված պրեպրինտում ներկայացված հետազոտական պնդում, ոչ թե ծրագրավորման գործակալների (coding agents) առավել հուսալիության՝ անկախ հետազոտություններով հաստատված ապացույց։
- 01
Հեղինակների նշած բարելավումները դիտարկեք որպես բացարձակ տարբերություն իրենց բազային մոդելի նկատմամբ, ոչ թե որպես երաշխիք այլ մոդելների, ռեպոզիտորիաների կամ աշխատանքային հոսքերի համար:
- 02
Մինչ մոտեցման վրա հիմնվելը ծանոթացեք հոդվածի ամբողջական տարբերակին. ներկայացված տվյալներում բացակայում են բազային ցուցանիշները, առաջադրանքների քանակը, վարիացիան, վիճակագրական թեստերը և կոնտեքստի կառավարման այլ մեթոդների հետ համեմատությունները:
- 03
Պրեպրինտին և դրա հետագա տարբերակներին հետևելու համար օգտվեք arXiv-ի առաջնային էջից՝ https://arxiv.org/abs/2610.02163v1
07
Այս թողարկման սահմանափակումները
Աղբյուրը arXiv-ի պրեպրինտի գրանցումն ու աբստրակտն է, ինչը գրախոսման կամ անկախ վավերացման ապացույց չէ։ [1]
Տրամադրված նյութում նշված չեն հանձնման բազային ցուցանիշները, առաջադրանքների քանակը, վիճակագրական վարիացիան, վստահելիության միջակայքերը կամ նշանակալիության թեստերը։ [1]
Ներկայացված չեն գնահատման (judge) չափանիշները, ծրագրային կոդը, ուսուցման տվյալները, աբլյացիոն վերլուծությունները, ձախողման դեպքերը կամ վերարտադրելիության նյութերը։ [1]
Տվյալները չեն պարունակում համեմատություններ կոնտեքստի կառավարման այլ մոտեցումների հետ կամ այլ մոդելների ու գործակալների կոնֆիգուրացիաների վրա ընդհանրացման ապացույցներ։ [1]
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


