Պրեպրինտը կասկածի տակ է դնում, թե ընթեռնելի հետագծերը բացահայտում են քայլի կարևորությունը
arXiv-ի պրեպրինտում նշվում է, որ chain-of-thought-ի քայլի տեքստը միայն մասամբ է բացահայտում դրա գործառնական կարևորությունը՝ հեղինակների կողմից շահման վրա հիմնված չափանիշով: Հեղինակները հայտնում են, որ ընդունակ LLM գնահատողները գերազանցել են բազային շեմը, բայց մնացել են աղմուկի վերին սահմանից ցածր: Նրանք նաև նշում են զգալի բարելավում քայլերի մակարդակով fine-tune եղած քննադատից՝ սխալ պատասխանների դեպքում, մինչդեռ ճիշտ պատասխանների դեպքում արդյունքը մնացել է վերին սահմանից հեռու: Տրամադրված տվյալները սահմանափակվում են պրեպրինտի գրանցմամբ և սեղմագրով [1]:
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ի պրեպրինտում ուսումնասիրվում է, թե արդյոք chain-of-thought-ի առանձին քայլի տեքստը բացահայտում է դրա ազդեցությունը մոդելի ակնկալվող շահման վրա: Հեղինակները նշում են, որ գնահատողները կարող են նույնականացնել մեծ կարևորություն ունեցող որոշ քայլեր, սակայն հետագծի տեքստը միայն մասամբ է բացահայտում քայլի կարևորությունն իրենց չափանիշով [1]:
01
Ինչ գիտենք այս պահին
- 01
[1] arXiv, «Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning», տարբերակ 1՝ https://arxiv.org/abs/2609.04194v1:
- 02
Տրամադրված հիմնական նյութը arXiv-ի գրանցումն ու սեղմագիրն են: Այն հաստատում է հեղինակների մեթոդի և նշված արդյունքների մեջբերումը, սակայն ոչ դրանց անկախ վավերացումը:
02
Գրանցման կարգավիճակ
arXiv-ում 1 տարբերակը գրանցված է որպես ներկայացված 2026 թ. սեպտեմբերի 3-ին:Կարևորության չափանիշը
Հեղինակները քայլի կարևորությունը սահմանում են որպես առավելություն (advantage)՝ ակնկալվող շահման փոփոխություն՝ գնահատված Մոնտե Կառլոյի rollout-ներով:LLM գնահատողի արդյունքը
Հեղինակների տվյալներով՝ ընդունակ գնահատողները գերազանցել են բազային շեմը մեծ առավելությամբ քայլերի դեպքում, բայց մնացել են աղմուկի վերին սահմանից ցածր:Fine-tuned քննադատող մոդել
Հեղինակները նշում են զգալի բարելավում սխալ պատասխանների համար: Ճիշտ պատասխանների դեպքում, ըստ նրանց, արդյունքը մնացել է վերին սահմանից հեռու:Ներկայացված մեթոդները, արդյունքներն ու մեկնաբանությունը պատկանում են պրեպրինտի հեղինակներին և տրամադրված նյութերում անկախ ստուգում չեն անցել [1]:
03
Ինչ է չափում հետազոտությունը
Տրամաբանական հետագծերը հաճախ դիտարկվում են որպես մատչելի նկարագրություն, թե մոդելն ինչպես է հանգել պատասխանին: Պրեպրինտը ստուգում է ավելի կոնկրետ հարցադրում. արդյոք առանձին քայլի տեքստը պարունակում է տեղեկություն այդ քայլի կարևորության մասին՝ հեղինակների կողմից շահման վրա հիմնված սահմանմամբ [1]:
- Հոդվածը քայլի կարևորությունը դիտարկում է որպես առավելություն (advantage)՝ տրամաբանական քայլը ներառելուց հետո ակնկալվող շահման փոփոխություն [1]:
- Սեղմագրում որպես ակնկալվող շահման օրինակ է բերվում վերջնական ճիշտ պատասխանի ստացումը [1]:
- Հեղինակները նշում են, որ առավելությունը գնահատում են Մոնտե Կառլոյի rollout-ների միջոցով [1]:
04
Ներկայացված փորձարարական արդյունքները
Հեղինակներն այս արդյունքները մեկնաբանում են որպես վկայություն, որ քայլի կարևորությունը միայն մասամբ է հնարավոր վերականգնել տրամաբանական հետագծի տեքստից: Դա փորձարկումների հեղինակային մեկնաբանությունն է, ոչ թե անկախ ստուգված եզրակացություն [1]:
- Հեղինակները հայտնում են, որ բավարար կարողություններ ունեցող LLM գնահատողները գերազանցել են բազային շեմը մեծ առավելություն ունեցող քայլերը նույնականացնելիս [1]:
- Նրանք նաև նշում են, որ գնահատողները զգալիորեն զիջել են աղմուկի վերին սահմանին [1]:
- Նրանք փոխանցում են, որ մոդելը քայլերի մակարդակով որպես քննադատ fine-tune անելը զգալի առաջընթաց է տվել սխալ պատասխանների դեպքում [1]:
- Ճիշտ պատասխանների դեպքում, ըստ հեղինակների, fine-tuned քննադատի աշխատանքը մնացել է վերին սահմանից հեռու [1]:
05
Գրանցումն ու սկզբնաղբյուրը
arXiv-ում նյութը գրանցված է որպես 1 տարբերակ՝ ներկայացված 2026 թ. սեպտեմբերի 3-ին: Հասանելի աղբյուրը բավարար է հոդվածը նույնականացնելու և դրա սեղմագրի պնդումները մեջբերելու համար, բայց ոչ փորձարկումներն անկախ գնահատելու նպատակով [1]:
06
Գործնական եզրակացություն
Մտածողության տեսանելի քայլերը դիտարկեք որպես գնահատման նյութ, ոչ թե որպես չափանիշ, թե որ քայլերն են գործառնական առումով կարևոր կամ փոխում ակնկալվող շահումը հոդվածում նկարագրված մոդելով [1]:
- 01
Հնարավորության դեպքում LLM գնահատողների (judges) կամ գործընթացի խրախուսման մոդելների (process reward models)՝ քայլերի մակարդակով տրված գնահատականները համեմատեք վերջնարդյունքի հետ կապված չափանիշների հետ, այլ ոչ թե հիմնվեք միայն ձևակերպման վրա [1]:
- 02
Մի՛ ենթադրեք, որ հստակ թվացող տրամաբանական քայլը կարևոր է զուտ այն պատճառով, որ հետագծում (trace) այն համոզիչ տեսք ունի [1]:
- 03
Մեթոդը կիրառելուց առաջ ծանոթացեք ամբողջական հոդվածին. տրամադրված նյութը չի պարունակում մեթոդների մանրամասները, տվյալների բազաները, մոդելների անվանումները, թվային արդյունքները, վստահության միջակայքերը կամ վերարտադրման նյութերը [1]:
07
Այս թողարկման սահմանափակումները
Սա arXiv-ի պրեպրինտ է: Տրամադրված տվյալները չեն հաստատում գրախոսման առկայությունը, արդյունքների անկախ վերարտադրումը կամ անկախ վավերացումը [1]:
Տրամադրված նյութում բացակայում են ամբողջական մեթոդները, տվյալների բազաները, մոդելների անվանումները, թվային արդյունքները, վստահության միջակայքերը և վերարտադրման նյութերը [1]:
arXiv-ում առկա է մեկնաբանություն, որ աշխատանքը հրապարակվել է COLM 2026-ում, սակայն տրամադրված նյութերն անկախ կերպով չեն ստուգում հրապարակման մանրամասները [1]:
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


