Նախատպագիր հոդվածը նկարագրում է ամփոփագրերի սխալներից մինչև LLM գնահատական տանող երկփուլ ուղին
Նախատպագիր հոդվածը հայտնում է, որ ամփոփագրեր գնահատող երկու մոդել attention-ի սկզբնական շերտերն օգտագործում են սխալների ազդանշանները համեմատելու և ուղղորդելու համար, որից հետո MLP-ի ավելի բարձր շերտերն այդ ազդանշանները միավորում են գնահատականների մեջ։ Llama-3-8B հիմնային ստուգիչ մոդելը պահպանել է ուղղորդումն ու բյուրեղացումը, սակայն ոչ նույն փուլային տարանջատումը․ հեղինակներն այս տարբերությունը վերագրում են լրացուցիչ ուսուցման կոնկրետ հետևանքներին։ Այս արդյունքները հեղինակային պնդումներ են կոնկրետ մոդելների համար և տրամադրված նյութերում անկախ ստուգում չեն անցել։
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ի նախատպագիր հոդվածում նշվում է, որ լրացուցիչ ուսուցում անցած երկու լեզվական մոդել-գնահատիչ ամփոփագրերում հայտնաբերված սխալները վերածում են գնահատականի երկու ներքին փուլով․ attention-ի սկզբնական շերտերը համեմատում են տեղային սխալներն ու ուղղորդում ազդանշանը, իսկ MLP-ի հաջորդ շերտերը միավորում են այն և գրանցում գնահատականը։ Փուլերի այս տարանջատումը նկարագրվել է Themis և Prometheus մոդելների համար․ հեղինակները փորձարկել են նաև Llama-3-8B հիմնային ստուգիչ մոդելը՝ ուսումնասիրելու ուղղորդումը, բյուրեղացումն ու լրացուցիչ ուսուցման հնարավոր ազդեցությունը։ Արդյունքները հիմնված են հեղինակների հաղորդած տվյալների վրա, սահմանափակված են ուսումնասիրված պայմաններում ամփոփման ընթեռնելիությամբ (Readability) և համարժեքությամբ (Adequacy), ինչպես նաև տրամադրված նյութերում չունեն անկախ ստուգում։ [1]
01
Ինչ գիտենք այս պահին
- 01
arXiv-ը գրանցել է Հիմիլ Վասավայի և Մին Ցզյանի v1 նախատպագիր աշխատությունը՝ ներկայացված 2026 թ. սեպտեմբերի 1-ին։ [1]
- 02
Հեղինակները նկարագրում են վերահսկվող փոփոխություններով փորձարկումներ Themis և Prometheus մոդելների վրա՝ ամփոփման Readability և Adequacy չափանիշներով, ինչպես նաև Llama-3-8B հիմնային ստուգիչ մոդելի կիրառմամբ։ [1]
- 03
Հեղինակները նշում են սխալների համեմատում և ուղղորդում 15-րդ շերտից ցածր, որին հաջորդում է MLP-ի վրա հիմնված միավորումն ու գնահատականի ձևավորումն ավելի բարձր շերտերում։ [1]
- 04
Հեղինակները հայտնում են ստուգիչ մոդելում ուղղորդման և բյուրեղացման առկայության մասին՝ առանց փուլերի տարանջատման, և լրացուցիչ ուսուցմանը վերագրում են երկու կոնկրետ փոփոխություն։ [1]
02
Հաղորդված երկփուլ մեխանիզմով գնահատող մոդելներ
Հեղինակները նկարագրում են Llama-3-8B-ի վրա հիմնված Themis-ի և Mistral-7B-ի վրա հիմնված Prometheus-ի մեխանիզմը։Նախնական մշակման հաղորդված փուլ
15-րդ շերտից ցածր attention-ը համեմատում է տեղային սխալները և ազդանշանն ուղղորդում մուտքային տվյալների վերջին դիրք։Որոշման բյուրեղացման հաղորդված շերտեր
Հեղինակները բյուրեղացումը տեղորոշում են Themis-ի 26-րդ և Prometheus-ի 25-րդ շերտում։Ստուգիչ նպատակով ուսումնասիրված լրացուցիչ մոդել
Llama-3-8B հիմնային մոդելն օգտագործվել է ուղղորդումը, բյուրեղացումը և փուլերի տարանջատումը ստուգելու համար։Այս պատկերը ներկայացնում է մեկ նախատպագրում հեղինակների նշած արդյունքները։ Տրամադրված նյութերը չեն պարունակում անկախ վերարտադրում։
03
Ինչ է փաստում գրանցումը
arXiv-ը գրանցել է Հիմիլ Վասավայի և Մին Ցզյանի «Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation» աշխատությունը՝ ներկայացված 2026 թ. սեպտեմբերի 1-ին։ Գրանցման համաձայն՝ հոդվածն ընդունվել է EMNLP 2026 գլխավոր գիտաժողովում, սակայն տրամադրված նյութերում առկա չէ գիտաժողովի որևէ էջ կամ գրախոսական նյութ, որն անկախ կերպով կհաստատեր այդ պնդումը։ [1]
Հեղինակները ներկայացնում են փորձարկումներ Llama-3-8B-ի վրա հիմնված Themis և Mistral-7B-ի վրա հիմնված Prometheus մոդելներով։ Նրանք գնահատել են ամփոփման Readability և Adequacy չափանիշները վերահսկվող փոփոխությունների միջոցով և նշել causal tracing-ի, logit-lens բառապաշարային պրոյեկցիայի ու attention-head knockout-ի կիրառման մասին։ [1]
04
Հեղինակների առաջարկած մեխանիզմը
Հոդվածը լրացուցիչ ուսուցում անցած գնահատող երկու մոդելներին էլ վերագրում է երկփուլ գործընթաց։ 15-րդ շերտից ցածր attention-ը կատարում է տեղային սխալների համեմատում և արդյունքն ուղղորդում մուտքային տվյալների վերջին դիրք։ Ավելի բարձր շերտերում MLP շերտերը միավորում են ազդանշանն ու գրանցում գնահատականը։ Սա փորձարկված մոդելների հեղինակային մեկնաբանությունն է, այլ ոչ թե LLM գնահատիչների համար հաստատված ընդհանուր բացատրություն։ [1]
Հեղինակները նշում են, որ որոշման ազդանշանը բյուրեղանում է Themis-ի 26-րդ և Prometheus-ի 25-րդ շերտում։ Նույն մասշտաբի Llama-3-8B հիմնային ստուգիչ մոդելը վերարտադրել է ուղղորդումն ու բյուրեղացումը, սակայն ոչ attention-ի նախնական աշխատանքի և MLP-ի հետագա աշխատանքի միջև նշված տարանջատումը։ Հեղինակներն այս համեմատությունը մեկնաբանում են նաև որպես լրացուցիչ ուսուցման բերած երկու փոփոխություն՝ վերջին դիրքում 15-րդից ցածր MLP շերտերի ազդեցության ճնշում և բյուրեղացում երկու շերտ ավելի շուտ։ [1]
05
Ինչու է այս տարբերակումը կարևոր
Ստուգիչ մոդելի հետ կապված արդյունքը նշանակում է, որ հոդվածը լրացուցիչ ուսուցումը չի ներկայացնում որպես ամբողջ ուղին զրոյից ստեղծող գործոն։ Փոխարենը, հեղինակները պնդում են, որ լրացուցիչ ուսուցումը փոփոխում է նախապես գոյություն ունեցող ուղղորդման և բյուրեղացման օրինաչափությունը։ Այդ մեկնաբանությունը մնում է այս նախատպագրի պնդումը և տրամադրված նյութերում անկախ կերպով չի հաստատվել։ [1]
Ամփոփագրերի ավտոմատ գնահատումն ուսումնասիրողների համար այս աշխատանքն առաջարկում է աուդիտի հստակ հարցադրում․ ո՞ւր է գնահատիչը տեղափոխում սխալի հետ կապված տեղեկությունը, և ո՞ր շերտում է գնահատականը դառնում վերջնական։ Այն չի ապացուցում, որ այս հարցադրումը, մեթոդը կամ շերտերի նկարագրված կառուցվածքը կկիրառվեն այլ մոդելների կամ գնահատման առաջադրանքների վրա։ Սկզբնական գրանցումը հասանելի է https://arxiv.org/abs/2609.01604v1 հասցեով։ [1]
06
Ինչպես կիրառել այս արդյունքը
Հոդվածը դիտարկեք որպես կոնկրետ մոդելներին վերաբերող հետազոտական հաշվետվություն, ոչ թե ավտոմատացված գնահատիչների աշխատանքի համընդհանուր նկարագրություն։
- 01
Ծանոթացեք arXiv-ի սկզբնական գրանցմանը՝ տարանջատելով հեղինակների մեխանիստական մեկնաբանություններն անկախ կերպով վերարտադրված փաստերից։
- 02
Ամփոփագրերը մեծ լեզվական մոդելներով (LLM) գնահատելիս փորձարկեք կոնկրետ գնահատիչը, առաջադրանքը և որակի չափանիշները, այլ ոչ թե ենթադրեք, որ նկարագրված օրինաչափությունը տարածվում է բոլոր դեպքերի վրա։
- 03
Հեղինակների կոդին և տվյալներին վստահելուց առաջ ուղղակիորեն ստուգեք դրանք, քանի որ ռեպոզիտորիայի ամբողջական հասցեն տրամադրված arXiv տեքստում հասանելի չէ։ [1]
07
Այս թողարկման սահմանափակումները
Սա նախատպագիր գրանցում է, ոչ թե դրա արդյունքների անկախ ստուգում։ [1]
Տրամադրված նյութերը չեն ներառում անկախ վերարտադրում, գրախոսական փաստաթղթեր կամ գիտաժողովի առանձին աղբյուր, որոնք կհաստատեին արդյունքները կամ գրանցման մեջ նշված ընդունման կարգավիճակը։ [1]
Հայտնի չէ, թե արդյոք նկարագրված մեխանիզմը տարածվում է Themis-ից, Prometheus-ից, Llama-3-8B ստուգիչ մոդելից, Readability և Adequacy չափանիշներից կամ ամփոփման գնահատումից դուրս։ [1]
arXiv-ի գրանցումը նշում է սկզբնական կոդի և տվյալների հրապարակման մասին, սակայն տրամադրված տեքստում ռեպոզիտորիայի ամբողջական հասցեն կամ թողարկման ամսաթվերը բացահայտված չեն։ [1]
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


