MCR-Bench-ն առաջարկում է բազմափուլ ստուգում AI կոդ-ռեվյուի համար
MCR-Bench-ը arXiv-ի պրեպրինտ է, որի հեղինակներն առաջարկում են թերությունների վիճակը հաշվի առնող բենչմարք բազմափուլ կոդ-ռեվյուի համար: Նրանք նկարագրում են 2,269 առաջադրանք հինգ լեզվով՝ թերությունների մետատվյալներով ու միջփուլային վիճակների պիտակներով, և նշում են, որ փորձարկված հիմնական LLM-ները դժվարանում են ռեվյուի փուլերի աճին զուգընթաց: Տրամադրված նյութը չի պարունակում այդ պնդումներն ամբողջությամբ գնահատելու համար անհրաժեշտ մեթոդաբանությունը, մոդելների միավորները, հասանելիության մանրամասները կամ անկախ հավաստումը:
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ում հրապարակված նոր պրեպրինտը ներկայացնում է MCR-Bench-ը, որը հեղինակները բնորոշում են որպես AI-ով աջակցվող կոդ-ռեվյուի գնահատման բենչմարք՝ նախատեսված ոչ թե մի փուլով ստատիկ որոշումների, այլ իտերատիվ, բազմափուլ գործընթացների համար: Գրանցման մեջ նշված է, որ հոդվածը ներկայացվել է 27 օգոստոսի 2026-ին, և նշվում է ISSTA 2026-ի ընդունման մասին: [1]
01
Ինչ գիտենք այս պահին
- 01
[1] arXiv-ի սկզբնական գրանցում և համառոտագիր՝ https://arxiv.org/abs/2608.27442v1 (տարբերակ 1, ներկայացված 27 օգոստոսի 2026-ին): Գրանցումը ներառում է բենչմարքի նկարագրությունը, հեղինակների փորձարարական պնդումները և ISSTA 2026-ի ընդունման մասին նշումը:
- 02
Տրամադրված տեղեկատվությունը սահմանափակվում է arXiv-ի պրեպրինտի գրանցմամբ և համառոտագրով. անկախ լուսաբանում, գիտաժողովի նյութեր կամ տվյալների շտեմարան չեն տրամադրվել:
02
Պրեպրինտի գրանցումը arXiv-ում
arXiv-ը նշում է 1 տարբերակը որպես ներկայացված 27 օգոստոսի 2026-ին:Բազմափուլ ռեվյուի առաջադրանքներ
Հեղինակները նշում են բենչմարքում իրական միջավայրի 2,269 առաջադրանքի մասին:Ծրագրավորման լեզուների ծածկույթ
Համառոտագրում նշվում է հինգ տարածված լեզվի մասին՝ առանց դրանք անվանելու:LLM-ների վերաբերյալ տվյալներ
Հեղինակների տվյալներով՝ արդյունավետությունը նվազում է փոխազդեցության փուլերի աճին զուգընթաց:Բենչմարքի շրջանակն ու բացահայտումները՝ ըստ arXiv-ի պրեպրինտի:
03
Ինչ է ավելացնում պրեպրինտը
«From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench» վերնագրով հոդվածը arXiv-ում դասակարգված է ծրագրային ապահովման ճարտարագիտության, արհեստական բանականության և հաշվողական լեզվաբանության բաժիններում: Հեղինակները MCR-Bench-ը ներկայացնում են որպես միջոց՝ ստուգելու, թե արդյոք համակարգը կարող է աշխատել այնպիսի ռեվյուի գործընթացում, որտեղ թերության կարգավիճակը կարող է փոխվել փուլից փուլ: [1]
Ըստ հեղինակների՝ յուրաքանչյուր առաջադրանք ներառում է թերության մետատվյալներ (օրինակ՝ նկարագրություն, տեսակ և լրջության աստիճան), ինչպես նաև միջփուլային վիճակի պիտակներ՝ թերության զարգացումն արտացոլելու համար: Սա առաջարկվող գնահատման գործիք է, և տրամադրված նյութերում չկան ապացույցներ, որ դրա կառուցվածքը կամ պիտակներն անկախ ստուգում են անցել: [1]
- Հեղինակները MCR-Bench-ը նկարագրում են որպես թերության վիճակը հաշվի առնող (defect state-aware) համակարգ, ինչը նշանակում է, որ առաջադրանքը պարունակում է տեղեկատվություն թերության մասին և պիտակներ, որոնք նախատեսված են ռեվյուի փուլերի ընթացքում դրա կարգավիճակին հետևելու համար:
- Նպատակը ծրագրավորողների և ռեվյուերների միջև իտերատիվ շփումները մոդելավորելն է, որը հեղինակները հակադրում են միափուլ, ստատիկ կոդ-ռեվյուի գնահատմանը:
- Բենչմարքը նկարագրվում է որպես իրական միջավայրի բազմափուլ 2,269 առաջադրանք պարունակող համակարգ՝ ընդգրկելով հինգ տարածված ծրագրավորման լեզու:
04
Ինչ է նշվում գործող LLM-ների մասին
Պրեպրինտի հեղինակները նշում են, որ իրենց փորձերը բացահայտել են թերություններ բազմափուլ ռեվյուի մշակման գործում: Մասնավորապես նշվում է, որ իմաստային առումով բարդ կամ ցածր տեսանելիություն ունեցող թերություններն ավելի հաճախ են վրիպել, իսկ կեղծ դրական (false positive) և կեղծ բացասական (false negative) արդյունքներն ունեցել են տարբեր պատճառներ: [1]
Սրանք հեղինակների կողմից նշված փորձարարական պնդումներ են, ոչ թե անկախ կերպով հաստատված եզրակացություններ: Տրամադրված նյութը չի պարունակում մոդելների անուններ, թվային չափումներ, փորձարարական պայմաններ, բազային ցուցանիշներ կամ վիճակագրական վերլուծություն, ուստի հնարավոր չէ գնահատել նշված ազդեցությունների չափը, ընդհանրացվելիությունը կամ վերարտադրելիությունը: [1]
- Հեղինակները նշում են հիմնական LLM-ների սահմանափակ ընդհանուր արդյունավետության մասին՝ թերությունների հայտնաբերման և դրանց կյանքի ցիկլի վիճակին հետևելու գործում:
- Նրանց փոխանցմամբ՝ արդյունավետությունը նվազում է փոխազդեցության փուլերի թվի աճին զուգընթաց:
- Նրանք արձանագրում են տարբերություններ ըստ թերության տեսակի և լրջության աստիճանի, իսկ սխալների վերլուծության մեջ մատնանշում են միջփուլային ժամանակային անհամապատասխանությունն ու երկարաժամկետ հիշողության անբավարարությունը:
05
Ինչն է մնում անհայտ
Տրամադրված նյութում չի նշվում, թե որ լեզուներն ու կոդ-ռեվյուի հարթակներն են ներկայացված, ինչպես են կազմվել առաջադրանքները կամ ինչպես է ստուգվել նշագրումների որակը: Նաև հաստատված չէ, թե արդյոք բենչմարքի տվյալները, կոդը կամ նշագրումները հնարավոր է ներբեռնել կամ վերաօգտագործել: [1]
AI ռեվյուի համակարգերը գնահատող թիմերի համար գլխավոր գործնական արժեքը գնահատման ձևաչափն է. թերությունների բազմափուլ հետևումը կարող է արժենալ փորձարկել միափուլ ստուգումներին զուգահեռ: Կիրառման ցանկացած որոշում պետք է կայացվի ամբողջական մեթոդաբանությանը և հասանելիության պայմաններին ծանոթանալուց, ինչպես նաև նախատեսված միջավայրում համակարգերն անկախ փորձարկելուց հետո: [1]
- Այս նյութը պետք է դիտարկել որպես հետազոտական բենչմարքի մասին տեղեկություն, ոչ թե ներդրման հանձնարարական:
- Համառոտագրի հիման վրա պետք չէ եզրակացություններ անել որևէ կոնկրետ լեզվի, ռեվյուի հարթակի կամ լիցենզիայի աջակցման մասին:
- Սկզբնաղբյուրի գրանցումը հասանելի է https://arxiv.org/abs/2608.27442v1 հասցեով:
06
Ինչ պետք է ստուգել օգտագործելուց առաջ
Տրամադրված նյութը չի հաստատում, որ բենչմարքը ներբեռնելի է կամ պատրաստ է գործնական կիրառման:
- 01
Մինչ ներկայացված արդյունքների վրա հիմնվելը, ծանոթացեք պրեպրինտի գրանցմանը և ամբողջական հոդվածին՝ https://arxiv.org/abs/2608.27442v1
- 02
Ստուգեք՝ արդյոք առաջադրանքները, նշագրումները, կոդը և գնահատման գործիքակազմը հանրամատչելի են, ինչպես նաև ճշտեք դրանց լիցենզիան ու թույլատրելի օգտագործման պայմանները:
- 03
Ուսումնասիրեք ամբողջական մեթոդաբանությունը, ներառյալ ներկայացված ծրագրավորման լեզուները, առաջադրանքների կառուցվածքը, նշագրումների ստուգումը, գնահատված մոդելները, չափանիշներն ու թվային արդյունքները:
- 04
Արդյունավետության վերաբերյալ բացահայտումները դիտարկեք որպես հեղինակների կողմից ներկայացված պրեպրինտի տվյալներ, ոչ թե AI կոդ-ռեվյուի որևէ գործիքի անկախ հավաստում:
07
Այս թողարկման սահմանափակումները
Սա պրեպրինտի գրանցում է: Տրամադրված նյութն անկախ կերպով չի հաստատում բենչմարքը, դրա նշագրումները կամ փորձարարական արդյունքները:
Ներկայացված համառոտագիրը չի նշում հինգ լեզուները, ռեվյուի ելակետային հարթակները, գնահատված մոդելները, չափանիշները, միավորները, բազային մակարդակները կամ վիճակագրական վերլուծությունը:
Տվյալների բազայի, կոդի, նշագրումների հասանելիությունն ու լիցենզավորումը տրամադրված նյութով հաստատված չեն:
ISSTA 2026-ի ընդունման մասին նշումն առկա է arXiv-ի գրանցման մեջ, սակայն այստեղ հաստատված չէ կոնֆերանսի կամ նյութերի ժողովածուի տվյալներով:
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:

