Պրեպրինտը պնդում է, որ դասակարգման վրա հիմնված հուշումների որոնումը կարող է ավելի լավ թիրախավորել AUROC-ը, քան ճշգրտությունը
Հեղինակներն առաջարկում են Ranking-PE մեթոդը՝ հուշումների էվոլյուցիայի մոտեցում, որն առանձին դեպքերի ճշտությունը փոխարինում է զույգերի դասակարգման արդյունքներով, որպեսզի թեկնածուների ընտրությունը թիրախավորի էմպիրիկ AUROC-ը։ Նրանք նշում են բարելավումներ ճշգրտության վրա հիմնված մեթոդի համեմատ MIMIC-ի վրա երեք հիվանդությունների փորձարկումներում, սակայն այս պնդումները վերցված են չգրախոսված պրեպրինտից, իսկ գնահատման կարևոր մանրամասները տրամադրված նյութում բացակայում են։
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

arXiv-ի նոր պրեպրինտն առաջարկում է մուլտիմոդալ կլինիկական մոդելների համար հուշումներ (prompts) ընտրել ոչ թե պարզ ճշգրտությամբ, այլ ըստ այն բանի, թե որքանով են դրանք դրական դեպքերը բացասականներից վեր դասակարգում։ Հեղինակների պնդմամբ՝ դասերի անհամամասնության պայմաններում սա ավելի լավ է համապատասխանում AUROC-ին, սակայն աշխատանքը դեռևս չգրախոսված հետազոտական պնդում է, ոչ թե կլինիկական կիրառման հիմք։
01
Ինչ գիտենք այս պահին
- 01
[1] «Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis» պրեպրինտի 1 տարբերակի arXiv գրառում, ներկայացված 2026 թ. սեպտեմբերի 30-ին՝ https://arxiv.org/abs/2609.40361v1:
- 02
Տրամադրված առաջնային գրառումն ամբողջական է, բայց բաղկացած է միայն ռեֆերատային էջի նյութերից. այն չի պարունակում գրախոսման, վերարտադրման կամ կլինիկական հավաստիության ապացույցներ։
02
Առաջարկվող մեթոդի օպտիմալացման թիրախը
Հեղինակների խոսքով՝ հուշումների թեկնածուներն ընտրվում են դրական-բացասական դեպքերի զույգերի դասակարգմամբ, որի միջինը էմպիրիկ AUROC-ն է։Հաղորդված արդյունքը Qwen3-VL-8B-ի համար
Հեղինակները նշում են AUROC-ի 5.8 տոկոսային կետով բարելավում՝ ճշգրտության վրա հիմնված իրենց հուշումների էվոլյուցիայի համեմատ։Հաղորդված արդյունքը MedGemma-4B-ի համար
Հեղինակները նշում են AUROC-ի 16.2 տոկոսային կետով բարելավում՝ ճշգրտության վրա հիմնված իրենց հուշումների էվոլյուցիայի համեմատ։Հետազոտության կարգավիճակը
Սա arXiv-ի 1-ին տարբերակի պրեպրինտ է։ Տրամադրված նյութում գրախոսման կամ անկախ վերարտադրման տվյալներ առկա չեն։Նշված արդյունքները վերագրվում են պրեպրինտի հեղինակներին և սահմանափակվում են MIMIC-ի տվյալներով ու երեք հիվանդությունների փորձարկումներով։
03
Ինչու է փոխվում թիրախային մետրիկան
«Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis» աշխատության հեղինակները պնդում են, որ առանձին օրինակների ճշտության վրա հիմնված հուշումների օպտիմալացումը համահունչ է accuracy մետրիկային, մինչդեռ իրենց նպատակն է բարելավել AUROC-ը։ Նրանք այս տարբերակումը հատկապես կարևոր են համարում այն դեպքերում, երբ դասերի անհամամասնությունը կարող է accuracy-ն դարձնել ապակողմնորոշող [1]։
- Ճշգրտությունը (accuracy) հաշվի է առնում, թե արդյոք կանխատեսումը ճիշտ է որոշման ընտրված շեմի դեպքում։ Հեղինակները փաստարկում են, որ խիստ անհամամասնական տվյալների պարագայում մեծամասնական դասը կանխատեսող մոդելը կարող է ցույց տալ բարձր ճշգրտություն, բայց չտարբերակել դրական և բացասական դեպքերը։
- AUROC-ն փոխարենը գնահատում է դասակարգումը դրական-բացասական զույգերում և կախված չէ մեկ ֆիքսված շեմից։ Հեղինակներն այն դիտարկում են որպես ավելի հարմար թիրախ իրենց հուշումների որոնման միջավայրի համար։
- Աշխատանքը տեխնիկական հետազոտական պրեպրինտ է և բժշկական ուղեցույց չէ։
04
Ինչ է նախատեսված անել Ranking-PE-ն
Պրեպրինտը ներկայացնում է «զույգերի մակարդակով Պարետոյի հուշումների էվոլյուցիան» (Ranking-PE)։ Հեղինակները նշում են, որ զույգերի դասակարգման արդյունքների միջինը, ըստ Վիլկոքսոն-Ման-Ուիթնիի նույնության, հավասար է էմպիրիկ AUROC-ին։ Դա է առաջարկվող հիմնական փոփոխությունը. հուշումների թեկնածուները գնահատվում և զարգացվում են ըստ դասակարգման որակի, այլ ոչ թե առանձին օրինակների ճշտության [1]։
- Հեղինակների նկարագրած գոյություն ունեցող որոնման մեթոդում յուրաքանչյուր թեկնածու հուշում ստանում է ճշտության գնահատական առանձին դեպքերի համար, իսկ դրանց միջինն ուղղորդում է ընտրությունը։
- Ranking-PE-ն այն փոխարինում է դրական-բացասական դեպքերի զույգերի արդյունքներով. թեկնածուն ստանում է դրական գնահատական, երբ դրական դեպքին տալիս է ավելի բարձր միավոր, քան զուգակցված բացասականին։
- Հեղինակների նշմամբ՝ այդ փոխարինումը կիրառվում է Պարետոյի գերիշխանության գնահատման, ռեֆլեքսիայի մոդելին տրվող հետադարձ կապի և թեկնածուի վերջնական ընտրության համար՝ առանց մոդելի լրացուցիչ կանչերի կամ սուրոգատ կորստի ֆունկցիայի։
05
Հաղորդված արդյունքները և կարևոր սահմանափակումները
Այս թվերն ու եզրակացությունները հեղինակների ներկայացրած տվյալներն են, ոչ թե անկախ ստուգված արդյունքներ։ Հասանելի աղբյուրը բավարար տեղեկություն չի տրամադրում փորձարարական կառուցվածքը, վարիացիան, վիճակագրական նշանակալիությունը, վերարտադրելիությունը կամ նշված MIMIC փորձարկումներից դուրս արդյունավետությունը գնահատելու համար [1]։
- MIMIC-ի տվյալներով երեք հիվանդությունների ուսումնասիրության արդյունքում հեղինակները հայտնում են, որ ճշգրտության վրա հիմնված հուշումների էվոլյուցիան կարող է վատթարացնել դասակարգման արդյունավետությունը։
- Նրանց տվյալներով՝ Ranking-PE-ն գերազանցել է ճշգրտության վրա հիմնված տարբերակին AUROC-ի 5.8 տոկոսային կետով fine-tuned Qwen3-VL-8B-ի և 16.2 տոկոսային կետով MedGemma-4B-ի դեպքում։
- Ըստ հեղինակների աբլյացիոն վերլուծությունների՝ բժշկական ուղղվածությամբ տեսողական հիմքը (ստացված vision encoder-ի վերահսկվող fine-tuning-ի կամ բժշկական նախաուսուցման միջոցով) անհրաժեշտ նախապայման է և չի կարող փոխարինվել միայն հուշումների որոնմամբ։
06
Ինչպես հասկանալ ներկայացված պնդումը
Հիմնական եզրահանգումը նեղ է. հուշումների էվոլյուցիայում օգտագործվող հետադարձ կապի ազդանշանի փոփոխությունը կարող է փոխել համակարգի օպտիմալացման ուղղությունը։ Ranking-PE-ի հուսալի արդյունավետության գնահատման համար անհրաժեշտ են բացակայող տեխնիկական և գնահատման մանրամասները, ինչպես նաև գիտական գրախոսում և անկախ վերարտադրում։ Հիմնական գրառումը հասանելի է https://arxiv.org/abs/2609.40361v1 հասցեով [1]։
- Տեխնիկական մասնագետների համար պրեպրինտն առաջարկում է որոնման նպատակը չափվող դասակարգման մետրիկային համապատասխանեցնելու կոնկրետ օրինակ։
- Գնահատողների համար այն ընդգծում է դասերի հավասարակշռությունը, ընտրված մետրիկան և այն ստուգելու անհրաժեշտությունը, թե արդյոք հուշումների ընտրությունը օպտիմալացված է հենց այդ մետրիկայի համար։
- Այն չի ներկայացնում ախտորոշիչ մեթոդ կամ կլինիկական որոշումների կայացման հիմք։
07
Ինչին ուշադրություն դարձնել հաջորդիվ
Ներկայացված տեղեկությունը նախատեսված է պրեպրինտի տեխնիկական դիտարկման, այլ ոչ թե գործնական կիրառման որոշումների համար։
- 01
Նախքան հրապարակված արդյունքների վրա հիմնվելը ծանոթացեք պրեպրինտի հիմնական գրառմանն ու ամբողջական հոդվածին՝ https://arxiv.org/abs/2609.40361v1
- 02
Ստուգեք հրապարակված կոդի, ամբողջական փորձարարական արձանագրությունների, վիճակագրական անորոշության և անկախ վերարտադրելիության առկայությունը. տրամադրված աղբյուրում դրանք ներկայացված չեն։
- 03
Մեթոդը կամ մոդելի նշված արդյունքները մի դիտարկեք որպես ախտորոշիչ ուղեցույց կամ կլինիկական պատրաստվածության ապացույց։
08
Այս թողարկման սահմանափակումները
Աղբյուրը 2026 թ. սեպտեմբերի 30-ին ներկայացված 1-ին տարբերակի arXiv պրեպրինտի մեկ ռեֆերատային գրառում է. այն չի փաստում գրախոսման կամ անկախ վերարտադրման մասին։
Տրամադրված նյութը չի պարունակում ամբողջական փորձարարական արձանագրությունը, ընտրանքի չափերը, վիճակագրական անորոշությունը, ելակետային կոդը, սխալների վերլուծությունը կամ տվյալների հասանելիության մանրամասները։
Ներկայացված արդյունքները վերաբերում են MIMIC-ի տվյալներով երեք հիվանդությունների և ցույց չեն տալիս արդյունավետությունն այլ միջավայրերում կամ կլինիկական կիրառման մեջ։
Աղբյուրում առկա որևէ տվյալ չի փաստում, որ այս մոտեցումն անվտանգ է, արդյունավետ կամ պիտանի ախտորոշման կամ բուժման նպատակներով օգտագործելու համար։
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


