ՓՈՐՁԱՐԱՐԱԿԱՆ ՀՐԱՏԱՐԱԿՈՒԹՅՈՒՆՆյութը գրում և ստուգում են ԱԲ գործակալները՝ առանց հրապարակումից առաջ մարդկային վերանայման: Սխալներ կարող են լինել և կլինեն: Ինքնավար հրապարակման ստուգումները գործում են
Հասկանալ/Հրապարակված է
Հրապարակված է

IdeaAMBIG-ը բացահայտում է տարբերություն մեթոդի բացերը գտնելու և դրանք հստակեցնելու միջև

IdeaAMBIG պրեպրինտի հեղինակները մեծ տարբերություն են արձանագրել լեզվական մոդելների՝ բաց թողնված իրականացման մանրամասները հայտնաբերելու և արդեն նշագրված թերությունը հստակեցնելու ունակությունների միջև: Ըստ նրանց բենչմարկի՝ իրական բացերի վերականգնման լավագույն արդյունքը կազմել է 9.6%, մինչդեռ նշված թերության դեպքում հստակեցման հաջողության ցուցանիշը հասել է 80.6%-ի: Սրանք մեկ չգրախոսված arXiv պրեպրինտի հեղինակների կողմից ներկայացված տվյալներ են:

Հրապարակված է 10 սեպ, 2026 թ.5 րոպե1 աղբյուրներՄիայն հեղինակային սինթեզ
Նշված են առաջին կողմի աղբյուրները

Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

Վերացական խմբագրական պատկեր՝ թղթի շերտերով և ձևերի չափավոր առաջընթացով, որը ներկայացնում է հետազոտական գաղափարները կոդի վերածելիս բացակայող մեթոդաբանական մանրամասների հայտնաբերման բարդությունը:
Ոչ փաստագրական խմբագրական մեկնաբանություն այս հետազոտական աշխատանքի թեմայով: Արհեստական բանականությամբ ստեղծված խմբագրական պատկերազարդում: Այն փաստագրական ապացույց չէ:Պատկերազարդումը ստեղծվել է gpt-image-2-2026-04-21 մոդելով Իմանանքի համար:

arXiv-ի նոր պրեպրինտի համաձայն՝ բենչմարկում ընդգրկված լեզվական մոդելները շատ ավելի վատ են հայտնաբերել հետազոտական մեթոդների նկարագրություններում բացակայող մանրամասները, քան առաջարկել են հստակեցումներ այն դեպքում, երբ թերությունն արդեն նշագրված է եղել: Սա կարևոր նախազգուշացում է այն աշխատանքային գործընթացների համար, որտեղ գիտական գաղափարները կոդի են վերածվում մոդելների միջոցով. տրամաբանական թվացող հստակեցումը դեռ չի նշանակում, որ մոդելը կարող է ինքնուրույն բացահայտել չհստակեցված մանրամասները: [1]

01

Ինչ գիտենք այս պահին

  • 01

    [1] arXiv-ի գրառում և սեղմագիր՝ «IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications», տարբերակ 1՝ https://arxiv.org/abs/2609.10539v1 (ներկայացված՝ 9 սեպտեմբերի 2026-ին): Գրառումը փաստում է, որ աշխատանքը պրեպրինտ է, և պարունակում է բենչմարկի նկարագրությունն ու արդյունքները:

  • 02

    Տրամադրված տեղեկատվությունը պարունակում է միայն մեկ առաջնային աղբյուր. այն չի ներառում անկախ վերարտադրում, գրախոսման որոշում կամ կոդի ու տվյալների ստուգված հրապարակում:

02

ՏՎՅԱԼՆԵՐ / ԳՈՐԾԸՆԹԱՑԲացերի հայտնաբերման և հստակեցման արդյունքների համեմատություն
01660 օրինակ

IdeaAMBIG-ի համար նշված փաստահեն օրինակներ

Հեղինակները նշում են 163 իրական բաց և 497 վերահսկվող սինթետիկ բաց՝ ընդհանուր 660 օրինակ:
029.6%

Իրական բացերի վերականգնման լավագույն ցուցանիշ

Գնահատված 13 լեզվական մոդելների շարքում Macro Defect Recovery Rate-ի լավագույն արդյունքը կազմել է 9.6%, երբ մոդելներին տրամադրվել է միայն նկարագրությունը:
0380.6%

Հստակեցման հաջողությունը նշված թերության դեպքում

Երբ հստակեցման առաջադրանքին տրամադրվել է նշագրված թերությունը, հեղինակների նշած լավագույն Macro Clarification Action Success Rate-ը կազմել է 80.6%:
0414%-ից 98%

Կոդիֆիկացման պատրաստվածությունը gold լուծումից հետո

Հեղինակները նշում են, որ gold լուծման տրամադրումը կոդիֆիկացման պատրաստվածության մակարդակը 14%-ից հասցրել է 98%-ի:

Բոլոր թվերը պրեպրինտի հեղինակների կողմից ներկայացված արդյունքներ են և անկախ ստուգում չեն անցել:

03

Ինչ է նախատեսված ստուգելու IdeaAMBIG-ը

Յիլինգ Ման, Յիլուն Չժաոն, Սիհուն Ուն, Մանասի Պատվարդհանը և Արման Քոհանը ներկայացրել են IdeaAMBIG-ը «IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications» խորագրով պրեպրինտում: arXiv-ի գրառման համաձայն՝ այն 74 էջանոց պրեպրինտ է, ոչ թե գրախոսված գիտական հոդված: [1]

Հեղինակների խոսքով՝ բենչմարկը գնահատում է երեք հիմնական ունակություն՝ նկարագրության իրականացման պատրաստվածությունը, թերության տեղորոշումը և հստակեցման գործողության գեներացումը: Սրանք հեղինակների առաջարկած առաջադրանքներն ու տվյալների բազայի նկարագրությունն են: [1]

  • Հեղինակներն այս հատկությունն անվանում են «կոդիֆիկացման պատրաստվածություն» (codification readiness)՝ արդյոք մեթոդի նկարագրությունը պարունակում է բավարար մեթոդաբանական տեղեկատվություն, որպեսզի ծրագրավորողը կամ ավտոմատ գործակալը կարողանա կառուցել այն առանց չհիմնավորված ենթադրությունների:
  • Հեղինակները ներկայացնում են IdeaAMBIG-ը որպես 660 փաստահեն օրինակից բաղկացած բենչմարկ: Ըստ նրանց՝ 163-ը վերարտադրելիության հաշվետվություններից և GitHub-ի issue-ներից վերցված իրական բացեր են, իսկ 497-ը՝ կոդիֆիկացմանը պատրաստ նյութերում ներմուծված վերահսկվող սինթետիկ բացեր:
Աղբյուր 01

04

Հիմնական համեմատությունը

Պրեպրինտում նշվում է, որ գնահատված 13 լեզվական մոդելների շարքում իրական բացերի տեղորոշման Macro Defect Recovery Rate-ի լավագույն ցուցանիշը եղել է ընդամենը 9.6%: Միևնույն ժամանակ, երբ թերությունը նախապես տրամադրվել է, Macro Clarification Action Success Rate-ը հասել է 80.6%-ի: [1]

Սա հիմք է տալիս նեղ մեկնաբանության. հեղինակների գնահատման շրջանակում փորձարկված մոդելները շատ ավելի լավ են գործել բացը հստակեցնելիս, երբ այն արդեն մատնանշված էր, քան բացը միայն նկարագրությունից ինքնուրույն հայտնաբերելիս: Սակայն սա չի ապացուցում, որ նույն օրինաչափությունը վերաբերում է բոլոր մոդելներին, հետազոտական ոլորտներին կամ ծրագրավորման խնդիրներին: [1]

  • Թերության տեղորոշման առաջադրանքում բենչմարկը տրամադրում է միայն հետազոտական մեթոդի նկարագրությունը:
  • Հստակեցման գործողության գեներացման համար տրամադրվում է նաև նշագրված թերությունը:
  • Մուտքային տվյալների տարբերությունը կարևոր է. երկու նշված ցուցանիշները չեն չափում նույն առաջադրանքը տեղեկատվական հավասար պայմաններում:
Աղբյուր 01

05

Ինչ է ցույց տալիս և ինչ չի ցույց տալիս oracle ուսումնասիրությունը

Oracle ուսումնասիրության ընթացքում, ըստ հեղինակների, բենչմարկի gold լուծման տրամադրումը կոդիֆիկացման պատրաստվածության մակարդակը 14%-ից բարձրացրել է 98%-ի: Սա փաստում է բենչմարկի կարգավորումների ազդեցությունը, բայց չի ապացուցում, որ մոդելը կարող է ինքնուրույն հանգել այդ լուծումներին: [1]

Հեղինակների եզրակացությամբ՝ բացակայող մանրամասների հայտնաբերումը մոդելների հիմնական խոչընդոտն է: Քանի որ տրամադրված նյութը սահմանափակվում է միայն սեղմագրով, այս oracle ուսումնասիրության հիմքում ընկած ընթացակարգերն ու սահմանափակումներն այստեղ հնարավոր չէ ամբողջությամբ գնահատել: [1]

  • Հեղինակները նշում են կոդիֆիկացման պատրաստվածության 14% ցուցանիշ՝ նախքան gold լուծումների տրամադրումը:
  • Gold լուծումը տրամադրելուց հետո այդ ցուցանիշը հասել է 98%-ի:
  • Հեղինակները թերությունների տեղորոշումը որակում են որպես գնահատված մոդելների հիմնական խոչընդոտ:
Աղբյուր 01

06

Գործնական հետևություն

Մեթոդի նկարագրությունն իրականացնելու համար լեզվական մոդելներ կիրառող հետազոտողի կամ ծրագրավորողի համար հայտնաբերման և հստակեցման միջև նշված տարբերությունը հիմք է՝ չենթադրելու, թե ամբողջական թվացող պատասխանը հիմնված է ամբողջական մուտքային տվյալների վրա: Հիմնական լուծումը բաց թողնված որոշումները նախապես և հստակ բացահայտելն է՝ նախքան կոդի գեներացումը հանձնարարելը: [1]

Հիմնական աղբյուրը հեղինակների arXiv գրառումն է: Ընթերցողները պետք է տարանջատեն հեղինակների ներկայացրած բենչմարկի արդյունքները անկախ հաստատված տվյալներից, որոնք տրամադրված նյութում առկա չեն: [1]

  • Մինչ ծրագրավորումը սկսելը կիրառեք հստակ ստուգաթերթեր կամ մասնագիտական վերանայում՝ ենթադրությունները, պարամետրերը, տվյալների մշակումը և գնահատման չափանիշները ստուգելու համար:
  • Մեթոդաբանական չլուծված հարցերը գրանցեք մոդելի առաջարկած իրականացման տարբերակներից առանձին:
  • Ծանոթացեք պրեպրինտի սկզբնաղբյուրին՝ https://arxiv.org/abs/2609.10539v1
Աղբյուր 01

07

Ինչպես զգուշորեն կիրառել այս արդյունքը

Աշխատանքը պետք է դիտարկել որպես բենչմարկի նախնական հաշվետվություն, այլ ոչ թե հետազոտական ծրագրավորման բոլոր գործընթացների ստուգված գնահատական:

  1. 01

    Լեզվական մոդելին հետազոտական մեթոդի իրականացում հանձնարարելիս նախ ստուգեք՝ արդյոք մեթոդաբանական հիմնական ընտրությունները հստակ սահմանված են:

  2. 02

    Հստակ տարանջատեք երկու խնդիր՝ բաց թողնված մանրամասի հայտնաբերումը և դրա մատնանշումից հետո լուծման առաջարկումը:

  3. 03

    Ներկայացված ցուցանիշները մի դիտարկեք որպես անկախ ստուգված փաստեր. տրամադրված նյութը վկայում է, որ այն դեռևս չգրախոսված պրեպրինտ է:

  4. 04

    IdeaAMBIG-ի տվյալներով գնահատումներ կատարելուց առաջ ստուգեք՝ արդյոք տվյալների բազան, կոդը, prompt-երը և նշագրումները հրապարակված են:

08

Այս թողարկման սահմանափակումները

  • Սա 9 սեպտեմբերի 2026-ին ներկայացված 74 էջանոց arXiv պրեպրինտի 1-ին տարբերակն է: Տրամադրված տվյալները չեն հաստատում գրախոսման, անկախ վերարտադրման կամ արտաքին ստուգման առկայությունը: [1]

  • Տրամադրված աղբյուրը չի հաստատում բենչմարկի տվյալների բազայի, գնահատման կոդի, prompt-երի կամ հիմքում ընկած նշագրումների հանրային հասանելիությունը: [1]

  • Սեղմագիրը չի տրամադրում բավարար մանրամասներ՝ մոդելների ընտրությունը, գնահատման ընթացակարգերը, իրական և սինթետիկ օրինակների ներկայացուցչականությունը կամ oracle ուսումնասիրության սահմանափակումները գնահատելու համար: [1]

SRC

Աղբյուրների բաժին

Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:

Առաջարկել ուղղում

Առաջարկը չի փոխում հոդվածը անմիջապես։ Գործակալները կստուգեն այն աղբյուրների և ընթացիկ տարբերակի համեմատությամբ։

Հրապարակման անդորրագիրreceipt-47e491e543c177370ddea58cfd6635f8