Պրեպրինտը ներկայացնում է մուլտիմոդալ ագենտների և մարդկանց ելակետային արդյունքի տարբերությունը 3D աշխարհների աուդիտում
WorldAuditBench-ը arXiv-ի պրեպրինտ է, որը նկարագրում է անոմալիաների 213 առաջադրանք սիմուլյացված ինտերակտիվ 3D 13 միջավայրում։ Դրա հեղինակները նշում են, որ փորձարկված հինգ մուլտիմոդալ մոդելները (երկու ճարտարապետությամբ) գրանցել են 6.6%-ից 42.3% հաջողություն՝ մարդկանց համար նշված 83.4% ցուցանիշի համեմատ։ Տրամադրված տվյալներով այս արդյունքները հաստատված չեն որպես գրախոսված կամ անկախ վերարտադրված։ [1]
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ի պրեպրինտում ներկայացվում է WorldAuditBench-ը՝ բենչմարք, որը ստուգում է մուլտիմոդալ AI ագենտների կարողությունը՝ տեղաշարժվելու սիմուլյացված 3D միջավայրերում և հայտնաբերելու անոմալիաներ։ Հեղինակները հայտնում են, որ փորձարկված ագենտների արդյունքները զիջել են մարդկանց համար նշված ելակետային ցուցանիշին, սակայն գնահատման կարևոր մանրամասները տրամադրված նյութում բացակայում են։ [1]
01
Ինչ գիտենք այս պահին
- 01
[1] arXiv, WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents, arXiv:2609.40325v1, ներկայացվել է 2026 թ. սեպտեմբերի 30-ին։ https://arxiv.org/abs/2609.40325v1
- 02
Տրամադրված առաջնային գրառումն ամբողջական է arXiv-ի սեղմագրի էջի համար, սակայն չի ներառում առաջադրանքների մակարդակի նյութեր կամ գնահատման ամբողջական ընթացակարգ։
02
Հեղինակների նկարագրած առաջադրանքները
Պրեպրինտը նկարագրում է 213 առաջադրանք՝ սիմուլյացված ինտերակտիվ 3D աշխարհների աուդիտի համար։Ինտերակտիվ 3D միջավայրեր
Ըստ հեղինակների՝ բենչմարքն ընդգրկում է 13 միջավայր։Ագենտների հաջողության նշված միջակայքը
Գնահատված հինգ մոդելների և երկու մոտեցումների դեպքում հեղինակները նշում են 6.6%-ից մինչև 42.3% հաջողություն։Մարդկանց հաշվետու ելակետային արդյունքը
Սեղմագրում նշվում է 83.4%, սակայն տրամադրված տվյալները չեն նկարագրում մարդկանց գնահատման ընթացակարգը։Բոլոր ցուցանիշները ներկայացված են պրեպրինտում և տրամադրված փաստաթղթով անկախ ստուգում չեն անցել։ [1]
03
Ինչ է նախատեսված ստուգել բենչմարքի միջոցով
Հեղինակները WorldAuditBench-ը ներկայացնում են որպես 3D աշխարհների աուդիտի բենչմարք՝ սիմուլյացված միջավայրում տեղաշարժվելիս անոմալիաները գտնելու և ստուգելու համար։ Նրանց ձևակերպմամբ՝ ագենտը պետք է ոչ միայն գործողություններ ընտրի աշխարհն ուսումնասիրելու համար, այլև տեսողական տրամաբանության միջոցով դատողություններ անի տեսածի վերաբերյալ։ [1]
Սա մուլտիմոդալ ագենտների նպատակային ստուգում է ինտերակտիվ սիմուլյացված աշխարհներում, ոչ թե AI-ի կարողությունների համապարփակ չափում։ Տրամադրված սեղմագրում չեն նշվում անոմալիաների հինգ խմբերը և չեն տրամադրվում առաջադրանքների մակարդակի նյութեր։ [1]
- Հեղինակները նկարագրում են անոմալիաների 213 առաջադրանք 13 ինտերակտիվ 3D միջավայրում։
- Ըստ հեղինակների՝ բենչմարքն ընդգրկում է անոմալիաների հինգ խումբ։
- Սեղմագրում բերված օրինակները ներառում են օդում կախված առարկաներ, թափանցելի պատեր և տեսարանին անհամապատասխան օբյեկտներ։
04
Ինչպես են հեղինակները գնահատել ագենտներին
Պրեպրինտում նկարագրվում է աուդիտի երկու մոտեցում։ Առաջինը տարանջատում է հետազոտումը անոմալիաների նույնականացումից։ Երկրորդն օգտագործում է end-to-end VLM ագենտ, որտեղ տեսողական տրամաբանությունն ուղղորդում է հաջորդ գործողությունը։ [1]
Հեղինակները նշում են, որ հետազոտման ռեսուրսների ֆիքսված սահմանաչափի պայմաններում փորձարկել են հինգ առաջատար մոդել։ Տրամադրված տվյալներում չեն նշվում այդ մոդելները, դրանց կարգավորումները կամ սահմանաչափի չափը, ուստի հնարավոր չէ առանձին համակարգերի կամ մոտեցումների մանրամասն համեմատություն կատարել։ [1]
- Երկփուլ մոտեցում. VLA (vision-language-action) հետազոտում, ապա VLM (vision-language-model) մոդելի միջոցով անոմալիաների նույնականացում։
- End-to-end մոտեցում. VLM ագենտն օգտագործում է տեսողական տրամաբանությունը գործողությունների ընտրությունն ուղղորդելու համար։
- Ըստ հեղինակների՝ հինգ առաջատար մոդելները գնահատվել են հետազոտման ռեսուրսների ֆիքսված սահմանաչափով։
05
Հաղորդված արդյունքները և անհայտ մնացած մանրամասները
Փորձարկված մոդելների և երկու մոտեցումների շրջանակում հեղինակները հայտնում են 6.6%-ից 42.3% հաջողության ցուցանիշներ՝ մարդկանց համար նշվող 83.4%-ի համեմատ։ Նրանք այս տարբերությունը ներկայացնում են որպես հետազոտման ընթացքում ապացույցներ հավաքելու և մեկնաբանելու ներկայիս սահմանափակումների վկայություն։ [1]
Սրանք պրեպրինտի հեղինակների հաղորդած տվյալներն են։ Տրամադրված գրառումը դրանք չի հաստատում որպես գրախոսված կամ անկախ վերարտադրված, և դրանում բացակայում են առաջադրանքների մակարդակի նյութերն ու գնահատման մանրամասները, որոնք անհրաժեշտ են համեմատության հուսալիությունը ստուգելու համար։ [1]
- Ագենտների հաջողության նշված ցուցանիշը տատանվել է 6.6%-ից մինչև 42.3%։
- Մարդկանց հաղորդված արդյունքը կազմել է 83.4%։
- Տրամադրված սեղմագիրը չի բացատրում մարդկանց հետազոտության մեթոդը կամ այն, թե որ կարգավորումներն են ապահովել նշված միավորները։
06
Ինչու է այս հետազոտությունն ուշագրավ
Աշխատանքն առաջադրում է նպատակային ստուգում ագենտների նախագծման կարևոր խնդրի համար՝ ինչպես տեսողական դիտարկումների միջոցով որոշել հետազոտման ուղղությունը, ապա ստուգել ենթադրյալ անոմալիան։ Հեղինակների հաղորդած արդյունքները ցույց են տալիս, որ փորձարկված կարգավորումները տվյալ բենչմարքում չեն հասել մարդկանց համար նշված ելակետային մակարդակին։ [1]
Ընթերցողները կարող են ծանոթանալ «WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents» աշխատանքի arXiv-ի առաջնային գրառմանը։ Այն արձանագրում է պրեպրինտի վերնագիրը, հեղինակներին, կատեգորիան, ներկայացման ամսաթիվը, բենչմարքի նկարագրությունը և հաղորդված արդյունքները։ [1]
- Առաջնային աղբյուր՝ arXiv:2609.40325v1:
- Գրանցված ներկայացման ամսաթիվ՝ 2026 թ. սեպտեմբերի 30։
- Կատեգորիա՝ cs.AI պրեպրինտ։
07
Ինչ է անհրաժեշտ հաշվի առնել արդյունքներին հիմնվելուց առաջ
Պրեպրինտը ներկայացնում է նոր բենչմարքի նախնական տվյալներ։ Արդյունավետության ցուցանիշները հաղորդվում են հեղինակների կողմից, իսկ տրամադրված աղբյուրում բացակայում են գրախոսման կամ անկախ վերարտադրման վերաբերյալ տեղեկությունները։ [1]
- 01
Ուսումնասիրել 1 տարբերակի առաջնային գրառումը՝ arXiv:2609.40325v1: [1]
- 02
Այս միավորները չդիտարկել որպես իրական աշխարհում ագենտների ընդհանուր հուսալիության չափանիշ. նշված առաջադրանքները վերաբերում են սիմուլյացված ինտերակտիվ 3D միջավայրերին։ [1]
- 03
Հետևել հետագա նյութերին, որոնք կսահմանեն անոմալիաների խմբերը, մոդելների կարգավորումները, հետազոտման ռեսուրսների սահմանաչափը, մարդկանց գնահատման ընթացակարգը, ինչպես նաև կտրամադրեն կոդի, առաջադրանքների կամ միջավայրերի հասանելիություն։ [1]
08
Այս թողարկման սահմանափակումները
Աշխատանքը arXiv-ում գրանցված է որպես cs.AI պրեպրինտ, որը ներկայացվել է 2026 թ. սեպտեմբերի 30-ին։ Տրամադրված տվյալներով այն հաստատված չէ որպես գրախոսված կամ անկախ վերարտադրված։ [1]
Տրամադրված սեղմագրում չեն նշվում անոմալիաների հինգ խմբերը, չեն բացահայտվում հինգ մոդելները և ամբողջությամբ չի հստակեցվում հետազոտման ռեսուրսների ֆիքսված սահմանաչափը։ [1]
Տրամադրված փաստաթուղթը չի բացատրում մարդկանց 83.4% ցուցանիշի հիմքում ընկած ընթացակարգը, վստահության միջակայքերը կամ ըստ կարգավորումների ստացված արդյունքները։ [1]
Տրամադրված գրառումը չի տրամադրում բենչմարքի կիրառման ուղեցույց, բաց կոդ, առաջադրանքների տվյալներ կամ միջավայրերի հասանելիություն։ [1]
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


