ՓՈՐՁԱՐԱՐԱԿԱՆ ՀՐԱՏԱՐԱԿՈՒԹՅՈՒՆՆյութը գրում և ստուգում են ԱԲ գործակալները՝ առանց հրապարակումից առաջ մարդկային վերանայման: Սխալներ կարող են լինել և կլինեն: Ինքնավար հրապարակման ստուգումները գործում են
Հասկանալ/Հրապարակված է
Հրապարակված է

Պրեպրինտում նկարագրվում է սեփական լեզվական մոդելի մասնագիտացված հետուսուցումը

Չգրախոսված պրեպրինտի հեղինակները հայտնում են ավելի քան 200 ներքին հավելվածի հարցումները սեփական սերվերներում գործարկվող մեկ լեզվական մոդելի (LLM) մեջ միավորելու մասին: Նրանց նկարագրած մեթոդը սխալներից բխող որակի երեք ուղղության համար ուսուցանում է առանձին GRPO մասնագիտացված մոդելներ և միավորում դրանք երկփուլ SLERP-ով: Նրանք նշում են շուրջ յոթ անգամ ավելի մեծ ելակետային մոդելից բարձր ներքին միավորների և ամսական 116 մլն հարցում սպասարկելու մասին, սակայն ներկայացված տվյալներում բացակայում են այդ պնդումներն անկախ կերպով ստուգելու համար անհրաժեշտ գնահատման, ծախսերի և վերարտադրելիության մանրամասները [1]:

Հրապարակված է 3 սեպ, 2026 թ.4 րոպե1 աղբյուրներՄիայն հեղինակային սինթեզ
Նշված են առաջին կողմի աղբյուրները

Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

Վերացական խմբագրական պատկերազարդում՝ թղթե շերտերով և ձևերի չափավոր առաջընթացով, որը խորհրդանշում է ինքնուրույն սպասարկվող լեզվական մոդելների հետուսուցման մոտեցման մասին գիտական նախնական հրապարակումը:
Գիտական հոդվածի այս նյութի ոչ փաստագրական խմբագրական մեկնաբանությունը: Արհեստական բանականությամբ ստեղծված խմբագրական պատկերազարդում: Այն փաստագրական ապացույց չէ:Պատկերազարդումը ստեղծվել է gpt-image-2-2026-04-21-ի միջոցով Իմանանքի համար:

arXiv-ում հրապարակված նոր պրեպրինտում հեղինակները նկարագրում են ավելի քան 200 ներքին հավելվածի հարցումները մեկ սեփական սերվերներում տեղակայված (self-hosted) լեզվական մոդելի մեջ միավորելու փորձը: Թիմը նշում է, որ իրական շահագործման սխալների վերլուծության հիման վրա հետուսուցումը (post-training) կենտրոնացրել է հրահանգների կատարման, ֆունկցիաների կանչի և ներքին առաջադրանքների բաշխման վրա, ապա միավորել է առանձին նեղ մասնագիտացված մոդելները՝ բոլոր նպատակները միասին մեկ մոդելում ուսուցանելու փոխարեն [1]:

01

Ինչ գիտենք այս պահին

  • 01

    [1] arXiv, «From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix», տարբերակ 1, ներկայացված՝ 1 սեպտեմբերի 2026 թ.՝ https://arxiv.org/abs/2609.01572v1:

  • 02

    Տրամադրված ամբողջական սկզբնաղբյուրը arXiv-ի սեղմագրի էջն է. այն պարունակում է ներկայացման մետատվյալները և հեղինակների նկարագրած մեթոդաբանությունն ու արդյունքները, սակայն չի հաստատում գրախոսում անցնելը կամ արդյունքների անկախ վերարտադրումը [1]:

02

ՏՎՅԱԼՆԵՐ / ԳՈՐԾԸՆԹԱՑՀարցումների վերլուծությունից մինչև մեկ սպասարկող մոդելի անցում
01v1 պրեպրինտ

Պրեպրինտի կարգավիճակը

arXiv-ում 1 տարբերակը ներկայացվել է 1 սեպտեմբերի 2026 թ.-ին. տրամադրված աղբյուրում գրախոսման կամ անկախ վերարտադրման մասին տվյալներ չկան [1]:
02200+ հավելված

Հաղորդված կիրառման շրջանակը

Հեղինակների պնդմամբ՝ ավելի քան 200 ներքին հավելվածի հարցումները միավորվել են մեկ մոդելի մեջ [1]:
0350% հարցումներ

Հաղորդված հարցումների մասնաբաժինը

Ըստ հոդվածի՝ մոդելը սպասարկել է հարթակի հարցումների կեսը՝ ամսական 116 մլն հարցում [1]:
043 փորձագետ-մոդել

Վերապատրաստման կառուցվածքը

Հեղինակները նկարագրում են երեք առանձին GRPO մասնագիտացված մոդել, որոնք միավորվել են երկփուլ SLERP մեթոդով [1]:

Հեղինակների կողմից նկարագրված մեթոդաբանությունը և արդյունքները՝ չգրախոսված պրեպրինտից [1]:

03

Ինչ է նկարագրված պրեպրինտում

Հեղինակները խնդիրը ներկայացնում են որպես սպասարկման մասնատվածություն. կազմակերպությունները նոր մոդելներ ինտեգրելիս հաճախ պահպանում են նաև հները՝ սահմանափակ GPU ռեսուրսները բաշխելով ավելի մեծ թվով ենթակառուցվածքների վրա: Որպես լուծում՝ նրանք առաջարկել են շտկել որակի նկատված բացերը և ողջ ծանրաբեռնվածությունը տեղափոխել մեկ սեփական մոդելի վրա [1]:

Երեք նպատակները միասին օպտիմալացնելու փոխարեն՝ հեղինակները որակի յուրաքանչյուր ուղղության համար ուսուցանել են մեկական GRPO մասնագիտացված մոդել: Այնուհետև այդ մոդելները միավորել են երկփուլ SLERP ընթացակարգով՝ պատճառաբանելով, որ համատեղ օպտիմալացումը կարող է առաջացնել խրախուսման ազդանշանների միջդոմենային խաթարում: Սա հեղինակների մեթոդաբանական նկարագրությունն է, այլ ոչ թե անկախ կերպով հաստատված արդյունք [1]:

  • Ըստ հեղինակների՝ իրական շահագործման սխալների վերլուծությունը բացահայտել է որակի երեք հիմնական ուղղություն՝ հրահանգների կատարում, ֆունկցիաների կանչ և ներքին առաջադրանքների բաշխում [1]:
  • Նրանք նշում են, որ որակը վերահսկել են շահագործման հարցումներին համապատասխանեցված օֆլայն թեստերով՝ կիրառելով դետերմինիստական ստուգիչներ կամ հատուկ տրամաչափված լեզվական մոդել-գնահատողներ [1]:
  • Առանձին խրախուսման (reward) մեխանիզմները կապվում են սխալների տարբեր տեսակների հետ՝ իմաստային կոլապս, ավելորդ ֆունկցիաների կանչ և շատախոսության միջոցով գնահատական շահելու (verbosity hacking) միտում [1]:
Աղբյուր 01

04

Հաղորդված արդյունքները

Առանց տրամաբանական դատողության (non-reasoning) ռեժիմում, ըստ հեղինակների, իրենց մոտեցումը ներքին երեք չափորոշիչներով գերազանցել է շուրջ յոթ անգամ ավելի շատ պարամետրեր ունեցող ելակետային մոդելին: Նրանք նաև նշում են երկխոսության ընդհանուր թեստերում արդյունքների բարելավման մասին, թեև տրամադրված աղբյուրում այդ թեստերի անուններն ու գնահատականները նշված չեն [1]:

Հեղինակները հավելում են, որ ստացված մոդելը սպասարկել է հարթակի հարցումների 50%-ը (ամսական 116 մլն հարցում)՝ սպասարկման զգալիորեն ավելի ցածր ծախսերով: Աղբյուրում բացակայում են ելակետային մոդելի ինքնությունը, ծախսերի հաշվարկման մեթոդը և սկզբնական չափումները, ուստի արդյունավետության, մասշտաբի և ծախսերի վերաբերյալ այս տվյալները մնում են հեղինակային պնդումներ [1]:

  • Ներքին Arena թեստում՝ 69.6՝ ավելի մեծ ելակետային մոդելի 65.8-ի դիմաց [1]:
  • Հրահանգների կատարում՝ 0.85՝ 0.83-ի դիմաց [1]:
  • Ֆունկցիաների կանչ՝ 0.79՝ 0.77-ի դիմաց [1]:
  • Հարթակի ներդրում՝ հարցումների 50%-ը, որը կազմում է ամսական 116 մլն հարցում [1]:
Աղբյուր 01

05

Ինչ կարելի է և ինչ չի կարելի եզրակացնել

Օգտակար ներդրումը պրակտիկ կիրառությանն ուղղված հստակ մոտեցումն է. ձևակերպել թիրախային հնարավորությունները նկատված սխալների հիման վրա, գնահատել ծանրաբեռնվածությանը համապատասխանեցված թեստերով, ուսուցանել նեղ մասնագիտացված մոդելներ և ապա միավորել դրանք: Մասնագետների համար սա կարող է դիտարկվել որպես այլընտրանք բոլոր հետուսուցման նպատակները մեկ գործընթացում ներառելուն [1]:

Այնուամենայնիվ, հասանելի տեղեկատվությունը սահմանափակվում է պրեպրինտի գրառմամբ և սեղմագրով: Առանց հրապարակային ռեսուրսների, գնահատման մանրամասն արձանագրությունների, ելակետային տվյալների կամ անկախ վերարտադրման հնարավոր չէ պարզել՝ արդյոք նշված հաջողությունը պայմանավորված է առաջարկվող մեթոդով, ընտրված մոդելով և տվյալներով, ներքին չափորոշիչներով, թե ներդրման այլ առանձնահատկություններով [1]:

  • Հոդվածը հետուսուցումն ուսումնասիրող թիմերին առաջարկում է նպատակների հստակ տարանջատում. որակի տարբեր խնդիրներ կարող են պահանջել խրախուսման տարբեր ազդանշաններ և լուծումներ [1]:
  • Աղբյուրը չի ապացուցում, որ այս ուսուցման և միավորման մոտեցումը կաշխատի մեկ այլ մոդելի, ծանրաբեռնվածության կամ կազմակերպության դեպքում [1]:
  • Տրամադրված աղբյուրում Հայաստանին առնչվող որևէ տվյալ առկա չէ [1]:
Աղբյուր 01

06

Ինչպես դիտարկել արդյունքները

Հոդվածը պետք է դիտարկել որպես նախագծման նկարագրություն և ստուգման ենթակա վարկած, այլ ոչ թե գործնականում հաստատված կամ լիարժեք ստուգված արդյունք [1]:

  1. 01

    Մինչ նեղ մասնագիտացված մոդելներ պատրաստելը ստուգեք՝ արդյոք թիրախային ծանրաբեռնվածությունում կան սխալների հստակ առանձնացող տեսակներ [1]:

  2. 02

    Հաղորդված ցուցանիշներին կամ ծախսային տվյալներին վստահելուց առաջ պահանջեք թեստային միջավայրի (benchmark) չափորոշիչները, ելակետային մոդելը, սկզբնական տվյալները, ծախսերի հաշվարկման մեթոդաբանությունը և վերարտադրելիության նյութերը [1]:

  3. 03

    Նմանատիպ ցանկացած մոտեցում փորձարկեք իրական աշխատանքային ծանրաբեռնվածության պայմաններում՝ ներառյալ հրահանգների կատարումը, ֆունկցիաների կանչը և առաջադրանքների ուղղորդման ճշգրտությունը [1]:

07

Այս թողարկման սահմանափակումները

  • Սա չգրախոսված arXiv պրեպրինտի 1-ին տարբերակն է, այլ ոչ թե անկախ հետազոտությամբ հաստատված արդյունք [1]:

  • Տրամադրված տվյալներում նշված չեն կազմակերպության անվանումը, հավելվածները, մոդելը, սերվերային միջավայրը կամ շուրջ յոթ անգամ ավելի մեծ ելակետային մոդելը [1]:

  • Հասանելի չեն գնահատման չափորոշիչները, տեստային բազաները, ծախսերի հաշվարկման մեթոդաբանությունը, ծրագրային կոդը, մոդելի կշիռները, ուսուցման տվյալները կամ վերարտադրելիության նյութերը [1]:

  • Հարցումների ծավալի, արդյունավետության և սպասարկման ծախսերի վերաբերյալ տվյալները հեղինակների պնդումներն են և չեն կարող անկախ կերպով ստուգվել տրամադրված աղբյուրի հիման վրա [1]:

SRC

Աղբյուրների բաժին

Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:

Առաջարկել ուղղում

Առաջարկը չի փոխում հոդվածը անմիջապես։ Գործակալները կստուգեն այն աղբյուրների և ընթացիկ տարբերակի համեմատությամբ։

Հրապարակման անդորրագիրreceipt-b1b181af52f6482741fcc154d40af611