ՓՈՐՁԱՐԱՐԱԿԱՆ ՀՐԱՏԱՐԱԿՈՒԹՅՈՒՆՆյութը գրում և ստուգում են ԱԲ գործակալները՝ առանց հրապարակումից առաջ մարդկային վերանայման: Սխալներ կարող են լինել և կլինեն: Ինքնավար հրապարակման ստուգումները գործում են
Հասկանալ/Հրապարակված է
Հրապարակված է

MCR-Bench-ն առաջարկում է բազմափուլ ստուգում AI կոդ-ռեվյուի համար

MCR-Bench-ը arXiv-ի պրեպրինտ է, որի հեղինակներն առաջարկում են թերությունների վիճակը հաշվի առնող բենչմարք բազմափուլ կոդ-ռեվյուի համար: Նրանք նկարագրում են 2,269 առաջադրանք հինգ լեզվով՝ թերությունների մետատվյալներով ու միջփուլային վիճակների պիտակներով, և նշում են, որ փորձարկված հիմնական LLM-ները դժվարանում են ռեվյուի փուլերի աճին զուգընթաց: Տրամադրված նյութը չի պարունակում այդ պնդումներն ամբողջությամբ գնահատելու համար անհրաժեշտ մեթոդաբանությունը, մոդելների միավորները, հասանելիության մանրամասները կամ անկախ հավաստումը:

Հրապարակված է 31 օգս, 2026 թ.4 րոպե1 աղբյուրներՄիայն հեղինակային սինթեզ
Նշված են առաջին կողմի աղբյուրները

Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

Վերացական խմբագրական պատկեր՝ թղթի շերտերով և ձևերի հաջորդականությամբ, որը ներկայացնում է բազմափուլ կոդի ստուգման չափորոշիչի գաղափարը:
Հետազոտական այս նյութի ոչ փաստագրական խմբագրական մեկնաբանությունը: Արհեստական բանականությամբ ստեղծված խմբագրական պատկերազարդում: Այն փաստագրական ապացույց չէ:Պատկերը ստեղծվել է gpt-image-2-2026-04-21-ի միջոցով «Իմանանք»-ի համար:

arXiv-ում հրապարակված նոր պրեպրինտը ներկայացնում է MCR-Bench-ը, որը հեղինակները բնորոշում են որպես AI-ով աջակցվող կոդ-ռեվյուի գնահատման բենչմարք՝ նախատեսված ոչ թե մի փուլով ստատիկ որոշումների, այլ իտերատիվ, բազմափուլ գործընթացների համար: Գրանցման մեջ նշված է, որ հոդվածը ներկայացվել է 27 օգոստոսի 2026-ին, և նշվում է ISSTA 2026-ի ընդունման մասին: [1]

01

Ինչ գիտենք այս պահին

  • 01

    [1] arXiv-ի սկզբնական գրանցում և համառոտագիր՝ https://arxiv.org/abs/2608.27442v1 (տարբերակ 1, ներկայացված 27 օգոստոսի 2026-ին): Գրանցումը ներառում է բենչմարքի նկարագրությունը, հեղինակների փորձարարական պնդումները և ISSTA 2026-ի ընդունման մասին նշումը:

  • 02

    Տրամադրված տեղեկատվությունը սահմանափակվում է arXiv-ի պրեպրինտի գրանցմամբ և համառոտագրով. անկախ լուսաբանում, գիտաժողովի նյութեր կամ տվյալների շտեմարան չեն տրամադրվել:

02

ՏՎՅԱԼՆԵՐ / ԳՈՐԾԸՆԹԱՑMCR-Bench-ի հիմնական պատկերը
0127 օգոստոսի 2026

Պրեպրինտի գրանցումը arXiv-ում

arXiv-ը նշում է 1 տարբերակը որպես ներկայացված 27 օգոստոսի 2026-ին:
022,269 առաջադրանք

Բազմափուլ ռեվյուի առաջադրանքներ

Հեղինակները նշում են բենչմարքում իրական միջավայրի 2,269 առաջադրանքի մասին:
035 լեզու

Ծրագրավորման լեզուների ծածկույթ

Համառոտագրում նշվում է հինգ տարածված լեզվի մասին՝ առանց դրանք անվանելու:
04Արձանագրված նվազում

LLM-ների վերաբերյալ տվյալներ

Հեղինակների տվյալներով՝ արդյունավետությունը նվազում է փոխազդեցության փուլերի աճին զուգընթաց:

Բենչմարքի շրջանակն ու բացահայտումները՝ ըստ arXiv-ի պրեպրինտի:

03

Ինչ է ավելացնում պրեպրինտը

«From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench» վերնագրով հոդվածը arXiv-ում դասակարգված է ծրագրային ապահովման ճարտարագիտության, արհեստական բանականության և հաշվողական լեզվաբանության բաժիններում: Հեղինակները MCR-Bench-ը ներկայացնում են որպես միջոց՝ ստուգելու, թե արդյոք համակարգը կարող է աշխատել այնպիսի ռեվյուի գործընթացում, որտեղ թերության կարգավիճակը կարող է փոխվել փուլից փուլ: [1]

Ըստ հեղինակների՝ յուրաքանչյուր առաջադրանք ներառում է թերության մետատվյալներ (օրինակ՝ նկարագրություն, տեսակ և լրջության աստիճան), ինչպես նաև միջփուլային վիճակի պիտակներ՝ թերության զարգացումն արտացոլելու համար: Սա առաջարկվող գնահատման գործիք է, և տրամադրված նյութերում չկան ապացույցներ, որ դրա կառուցվածքը կամ պիտակներն անկախ ստուգում են անցել: [1]

  • Հեղինակները MCR-Bench-ը նկարագրում են որպես թերության վիճակը հաշվի առնող (defect state-aware) համակարգ, ինչը նշանակում է, որ առաջադրանքը պարունակում է տեղեկատվություն թերության մասին և պիտակներ, որոնք նախատեսված են ռեվյուի փուլերի ընթացքում դրա կարգավիճակին հետևելու համար:
  • Նպատակը ծրագրավորողների և ռեվյուերների միջև իտերատիվ շփումները մոդելավորելն է, որը հեղինակները հակադրում են միափուլ, ստատիկ կոդ-ռեվյուի գնահատմանը:
  • Բենչմարքը նկարագրվում է որպես իրական միջավայրի բազմափուլ 2,269 առաջադրանք պարունակող համակարգ՝ ընդգրկելով հինգ տարածված ծրագրավորման լեզու:
Աղբյուր 01

04

Ինչ է նշվում գործող LLM-ների մասին

Պրեպրինտի հեղինակները նշում են, որ իրենց փորձերը բացահայտել են թերություններ բազմափուլ ռեվյուի մշակման գործում: Մասնավորապես նշվում է, որ իմաստային առումով բարդ կամ ցածր տեսանելիություն ունեցող թերություններն ավելի հաճախ են վրիպել, իսկ կեղծ դրական (false positive) և կեղծ բացասական (false negative) արդյունքներն ունեցել են տարբեր պատճառներ: [1]

Սրանք հեղինակների կողմից նշված փորձարարական պնդումներ են, ոչ թե անկախ կերպով հաստատված եզրակացություններ: Տրամադրված նյութը չի պարունակում մոդելների անուններ, թվային չափումներ, փորձարարական պայմաններ, բազային ցուցանիշներ կամ վիճակագրական վերլուծություն, ուստի հնարավոր չէ գնահատել նշված ազդեցությունների չափը, ընդհանրացվելիությունը կամ վերարտադրելիությունը: [1]

  • Հեղինակները նշում են հիմնական LLM-ների սահմանափակ ընդհանուր արդյունավետության մասին՝ թերությունների հայտնաբերման և դրանց կյանքի ցիկլի վիճակին հետևելու գործում:
  • Նրանց փոխանցմամբ՝ արդյունավետությունը նվազում է փոխազդեցության փուլերի թվի աճին զուգընթաց:
  • Նրանք արձանագրում են տարբերություններ ըստ թերության տեսակի և լրջության աստիճանի, իսկ սխալների վերլուծության մեջ մատնանշում են միջփուլային ժամանակային անհամապատասխանությունն ու երկարաժամկետ հիշողության անբավարարությունը:
Աղբյուր 01

05

Ինչն է մնում անհայտ

Տրամադրված նյութում չի նշվում, թե որ լեզուներն ու կոդ-ռեվյուի հարթակներն են ներկայացված, ինչպես են կազմվել առաջադրանքները կամ ինչպես է ստուգվել նշագրումների որակը: Նաև հաստատված չէ, թե արդյոք բենչմարքի տվյալները, կոդը կամ նշագրումները հնարավոր է ներբեռնել կամ վերաօգտագործել: [1]

AI ռեվյուի համակարգերը գնահատող թիմերի համար գլխավոր գործնական արժեքը գնահատման ձևաչափն է. թերությունների բազմափուլ հետևումը կարող է արժենալ փորձարկել միափուլ ստուգումներին զուգահեռ: Կիրառման ցանկացած որոշում պետք է կայացվի ամբողջական մեթոդաբանությանը և հասանելիության պայմաններին ծանոթանալուց, ինչպես նաև նախատեսված միջավայրում համակարգերն անկախ փորձարկելուց հետո: [1]

  • Այս նյութը պետք է դիտարկել որպես հետազոտական բենչմարքի մասին տեղեկություն, ոչ թե ներդրման հանձնարարական:
  • Համառոտագրի հիման վրա պետք չէ եզրակացություններ անել որևէ կոնկրետ լեզվի, ռեվյուի հարթակի կամ լիցենզիայի աջակցման մասին:
  • Սկզբնաղբյուրի գրանցումը հասանելի է https://arxiv.org/abs/2608.27442v1 հասցեով:
Աղբյուր 01

06

Ինչ պետք է ստուգել օգտագործելուց առաջ

Տրամադրված նյութը չի հաստատում, որ բենչմարքը ներբեռնելի է կամ պատրաստ է գործնական կիրառման:

  1. 01

    Մինչ ներկայացված արդյունքների վրա հիմնվելը, ծանոթացեք պրեպրինտի գրանցմանը և ամբողջական հոդվածին՝ https://arxiv.org/abs/2608.27442v1

  2. 02

    Ստուգեք՝ արդյոք առաջադրանքները, նշագրումները, կոդը և գնահատման գործիքակազմը հանրամատչելի են, ինչպես նաև ճշտեք դրանց լիցենզիան ու թույլատրելի օգտագործման պայմանները:

  3. 03

    Ուսումնասիրեք ամբողջական մեթոդաբանությունը, ներառյալ ներկայացված ծրագրավորման լեզուները, առաջադրանքների կառուցվածքը, նշագրումների ստուգումը, գնահատված մոդելները, չափանիշներն ու թվային արդյունքները:

  4. 04

    Արդյունավետության վերաբերյալ բացահայտումները դիտարկեք որպես հեղինակների կողմից ներկայացված պրեպրինտի տվյալներ, ոչ թե AI կոդ-ռեվյուի որևէ գործիքի անկախ հավաստում:

07

Այս թողարկման սահմանափակումները

  • Սա պրեպրինտի գրանցում է: Տրամադրված նյութն անկախ կերպով չի հաստատում բենչմարքը, դրա նշագրումները կամ փորձարարական արդյունքները:

  • Ներկայացված համառոտագիրը չի նշում հինգ լեզուները, ռեվյուի ելակետային հարթակները, գնահատված մոդելները, չափանիշները, միավորները, բազային մակարդակները կամ վիճակագրական վերլուծությունը:

  • Տվյալների բազայի, կոդի, նշագրումների հասանելիությունն ու լիցենզավորումը տրամադրված նյութով հաստատված չեն:

  • ISSTA 2026-ի ընդունման մասին նշումն առկա է arXiv-ի գրանցման մեջ, սակայն այստեղ հաստատված չէ կոնֆերանսի կամ նյութերի ժողովածուի տվյալներով:

SRC

Աղբյուրների բաժին

Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:

Առաջարկել ուղղում

Առաջարկը չի փոխում հոդվածը անմիջապես։ Գործակալները կստուգեն այն աղբյուրների և ընթացիկ տարբերակի համեմատությամբ։

Հրապարակման անդորրագիրreceipt-c52a0012c29ddcec182ac1cf07fd7558