Պրեպրինտում նկարագրվում է սեփական լեզվական մոդելի մասնագիտացված հետուսուցումը
Չգրախոսված պրեպրինտի հեղինակները հայտնում են ավելի քան 200 ներքին հավելվածի հարցումները սեփական սերվերներում գործարկվող մեկ լեզվական մոդելի (LLM) մեջ միավորելու մասին: Նրանց նկարագրած մեթոդը սխալներից բխող որակի երեք ուղղության համար ուսուցանում է առանձին GRPO մասնագիտացված մոդելներ և միավորում դրանք երկփուլ SLERP-ով: Նրանք նշում են շուրջ յոթ անգամ ավելի մեծ ելակետային մոդելից բարձր ներքին միավորների և ամսական 116 մլն հարցում սպասարկելու մասին, սակայն ներկայացված տվյալներում բացակայում են այդ պնդումներն անկախ կերպով ստուգելու համար անհրաժեշտ գնահատման, ծախսերի և վերարտադրելիության մանրամասները [1]:
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ում հրապարակված նոր պրեպրինտում հեղինակները նկարագրում են ավելի քան 200 ներքին հավելվածի հարցումները մեկ սեփական սերվերներում տեղակայված (self-hosted) լեզվական մոդելի մեջ միավորելու փորձը: Թիմը նշում է, որ իրական շահագործման սխալների վերլուծության հիման վրա հետուսուցումը (post-training) կենտրոնացրել է հրահանգների կատարման, ֆունկցիաների կանչի և ներքին առաջադրանքների բաշխման վրա, ապա միավորել է առանձին նեղ մասնագիտացված մոդելները՝ բոլոր նպատակները միասին մեկ մոդելում ուսուցանելու փոխարեն [1]:
01
Ինչ գիտենք այս պահին
- 01
[1] arXiv, «From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix», տարբերակ 1, ներկայացված՝ 1 սեպտեմբերի 2026 թ.՝ https://arxiv.org/abs/2609.01572v1:
- 02
Տրամադրված ամբողջական սկզբնաղբյուրը arXiv-ի սեղմագրի էջն է. այն պարունակում է ներկայացման մետատվյալները և հեղինակների նկարագրած մեթոդաբանությունն ու արդյունքները, սակայն չի հաստատում գրախոսում անցնելը կամ արդյունքների անկախ վերարտադրումը [1]:
02
Պրեպրինտի կարգավիճակը
arXiv-ում 1 տարբերակը ներկայացվել է 1 սեպտեմբերի 2026 թ.-ին. տրամադրված աղբյուրում գրախոսման կամ անկախ վերարտադրման մասին տվյալներ չկան [1]:Հաղորդված կիրառման շրջանակը
Հեղինակների պնդմամբ՝ ավելի քան 200 ներքին հավելվածի հարցումները միավորվել են մեկ մոդելի մեջ [1]:Հաղորդված հարցումների մասնաբաժինը
Ըստ հոդվածի՝ մոդելը սպասարկել է հարթակի հարցումների կեսը՝ ամսական 116 մլն հարցում [1]:Վերապատրաստման կառուցվածքը
Հեղինակները նկարագրում են երեք առանձին GRPO մասնագիտացված մոդել, որոնք միավորվել են երկփուլ SLERP մեթոդով [1]:Հեղինակների կողմից նկարագրված մեթոդաբանությունը և արդյունքները՝ չգրախոսված պրեպրինտից [1]:
03
Ինչ է նկարագրված պրեպրինտում
Հեղինակները խնդիրը ներկայացնում են որպես սպասարկման մասնատվածություն. կազմակերպությունները նոր մոդելներ ինտեգրելիս հաճախ պահպանում են նաև հները՝ սահմանափակ GPU ռեսուրսները բաշխելով ավելի մեծ թվով ենթակառուցվածքների վրա: Որպես լուծում՝ նրանք առաջարկել են շտկել որակի նկատված բացերը և ողջ ծանրաբեռնվածությունը տեղափոխել մեկ սեփական մոդելի վրա [1]:
Երեք նպատակները միասին օպտիմալացնելու փոխարեն՝ հեղինակները որակի յուրաքանչյուր ուղղության համար ուսուցանել են մեկական GRPO մասնագիտացված մոդել: Այնուհետև այդ մոդելները միավորել են երկփուլ SLERP ընթացակարգով՝ պատճառաբանելով, որ համատեղ օպտիմալացումը կարող է առաջացնել խրախուսման ազդանշանների միջդոմենային խաթարում: Սա հեղինակների մեթոդաբանական նկարագրությունն է, այլ ոչ թե անկախ կերպով հաստատված արդյունք [1]:
- Ըստ հեղինակների՝ իրական շահագործման սխալների վերլուծությունը բացահայտել է որակի երեք հիմնական ուղղություն՝ հրահանգների կատարում, ֆունկցիաների կանչ և ներքին առաջադրանքների բաշխում [1]:
- Նրանք նշում են, որ որակը վերահսկել են շահագործման հարցումներին համապատասխանեցված օֆլայն թեստերով՝ կիրառելով դետերմինիստական ստուգիչներ կամ հատուկ տրամաչափված լեզվական մոդել-գնահատողներ [1]:
- Առանձին խրախուսման (reward) մեխանիզմները կապվում են սխալների տարբեր տեսակների հետ՝ իմաստային կոլապս, ավելորդ ֆունկցիաների կանչ և շատախոսության միջոցով գնահատական շահելու (verbosity hacking) միտում [1]:
04
Հաղորդված արդյունքները
Առանց տրամաբանական դատողության (non-reasoning) ռեժիմում, ըստ հեղինակների, իրենց մոտեցումը ներքին երեք չափորոշիչներով գերազանցել է շուրջ յոթ անգամ ավելի շատ պարամետրեր ունեցող ելակետային մոդելին: Նրանք նաև նշում են երկխոսության ընդհանուր թեստերում արդյունքների բարելավման մասին, թեև տրամադրված աղբյուրում այդ թեստերի անուններն ու գնահատականները նշված չեն [1]:
Հեղինակները հավելում են, որ ստացված մոդելը սպասարկել է հարթակի հարցումների 50%-ը (ամսական 116 մլն հարցում)՝ սպասարկման զգալիորեն ավելի ցածր ծախսերով: Աղբյուրում բացակայում են ելակետային մոդելի ինքնությունը, ծախսերի հաշվարկման մեթոդը և սկզբնական չափումները, ուստի արդյունավետության, մասշտաբի և ծախսերի վերաբերյալ այս տվյալները մնում են հեղինակային պնդումներ [1]:
05
Ինչ կարելի է և ինչ չի կարելի եզրակացնել
Օգտակար ներդրումը պրակտիկ կիրառությանն ուղղված հստակ մոտեցումն է. ձևակերպել թիրախային հնարավորությունները նկատված սխալների հիման վրա, գնահատել ծանրաբեռնվածությանը համապատասխանեցված թեստերով, ուսուցանել նեղ մասնագիտացված մոդելներ և ապա միավորել դրանք: Մասնագետների համար սա կարող է դիտարկվել որպես այլընտրանք բոլոր հետուսուցման նպատակները մեկ գործընթացում ներառելուն [1]:
Այնուամենայնիվ, հասանելի տեղեկատվությունը սահմանափակվում է պրեպրինտի գրառմամբ և սեղմագրով: Առանց հրապարակային ռեսուրսների, գնահատման մանրամասն արձանագրությունների, ելակետային տվյալների կամ անկախ վերարտադրման հնարավոր չէ պարզել՝ արդյոք նշված հաջողությունը պայմանավորված է առաջարկվող մեթոդով, ընտրված մոդելով և տվյալներով, ներքին չափորոշիչներով, թե ներդրման այլ առանձնահատկություններով [1]:
- Հոդվածը հետուսուցումն ուսումնասիրող թիմերին առաջարկում է նպատակների հստակ տարանջատում. որակի տարբեր խնդիրներ կարող են պահանջել խրախուսման տարբեր ազդանշաններ և լուծումներ [1]:
- Աղբյուրը չի ապացուցում, որ այս ուսուցման և միավորման մոտեցումը կաշխատի մեկ այլ մոդելի, ծանրաբեռնվածության կամ կազմակերպության դեպքում [1]:
- Տրամադրված աղբյուրում Հայաստանին առնչվող որևէ տվյալ առկա չէ [1]:
06
Ինչպես դիտարկել արդյունքները
Հոդվածը պետք է դիտարկել որպես նախագծման նկարագրություն և ստուգման ենթակա վարկած, այլ ոչ թե գործնականում հաստատված կամ լիարժեք ստուգված արդյունք [1]:
- 01
Մինչ նեղ մասնագիտացված մոդելներ պատրաստելը ստուգեք՝ արդյոք թիրախային ծանրաբեռնվածությունում կան սխալների հստակ առանձնացող տեսակներ [1]:
- 02
Հաղորդված ցուցանիշներին կամ ծախսային տվյալներին վստահելուց առաջ պահանջեք թեստային միջավայրի (benchmark) չափորոշիչները, ելակետային մոդելը, սկզբնական տվյալները, ծախսերի հաշվարկման մեթոդաբանությունը և վերարտադրելիության նյութերը [1]:
- 03
Նմանատիպ ցանկացած մոտեցում փորձարկեք իրական աշխատանքային ծանրաբեռնվածության պայմաններում՝ ներառյալ հրահանգների կատարումը, ֆունկցիաների կանչը և առաջադրանքների ուղղորդման ճշգրտությունը [1]:
07
Այս թողարկման սահմանափակումները
Սա չգրախոսված arXiv պրեպրինտի 1-ին տարբերակն է, այլ ոչ թե անկախ հետազոտությամբ հաստատված արդյունք [1]:
Տրամադրված տվյալներում նշված չեն կազմակերպության անվանումը, հավելվածները, մոդելը, սերվերային միջավայրը կամ շուրջ յոթ անգամ ավելի մեծ ելակետային մոդելը [1]:
Հասանելի չեն գնահատման չափորոշիչները, տեստային բազաները, ծախսերի հաշվարկման մեթոդաբանությունը, ծրագրային կոդը, մոդելի կշիռները, ուսուցման տվյալները կամ վերարտադրելիության նյութերը [1]:
Հարցումների ծավալի, արդյունավետության և սպասարկման ծախսերի վերաբերյալ տվյալները հեղինակների պնդումներն են և չեն կարող անկախ կերպով ստուգվել տրամադրված աղբյուրի հիման վրա [1]:
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


