Նախատպությունը հայտնում է ընդհանուր լեզվական և կենսաբժշկական հալյուցինացիաների հայտնաբերման միջև եղած տարբերության մասին
Հեղինակները հայտնում են, որ իրենց ընդհանուր տիրույթի դետեկտորը SciFact-ում հասել է F1՝ 0.52-ի՝ HaluEval-ի համեմատ ավելի ցածր արդյունք ցուցաբերելով, իսկ SciFact-ի վրա fine-tuning արված PubMedBERT մոդելը գրանցել է F1՝ 0.63 և AUROC՝ 0.81: Սա մատնանշում է տիրույթների միջև տեղափոխման խնդիրը նշված փորձում, սակայն սա նախատպության արդյունք է, որի համար տրամադրված փաստերը չեն հաստատում ո՛չ գրախոսում անցնելը, ո՛չ էլ անկախ վերարտադրումը:
Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

2026 թ. սեպտեմբերի 10-ին arXiv ներկայացված նախատպությունը հայտնում է, որ հալյուցինացիաների հայտնաբերման մոտեցումը, որն ընդհանուր տիրույթի HaluEval-ում ունեցել է բարձր ցուցանիշներ, ավելի ցածր արդյունավետություն է դրսևորել կենսաբժշկական SciFact բենչմարք տեղափոխվելիս: Հեղինակները հաղորդում են SciFact-ում ավելի բարձր միավորի մասին այդ բենչմարքի վրա PubMedBERT-ի fine-tuning-ից հետո: Սա հոդվածի գնահատման կարգավորումներից բխող նեղ արդյունք է. տրամադրված փաստերը չեն հաստատում գրախոսում անցած լինելը կամ անկախ վերարտադրումը: [1]
01
02
Հաղորդված HaluEval արդյունքը ընդհանուր տիրույթի առաջադրանքներում
Հեղինակները նշում են ընդհանուր F1՝ 0.915 իրենց համակարգի համար HaluEval ընդհանուր տիրույթի առաջադրանքներում:Հաղորդված տեղափոխման միավորը կենսաբժշկական SciFact բենչմարքում
Հեղինակները նշում են F1՝ 0.52, երբ ընդհանուր տիրույթի ուսուցումը կիրառվում է SciFact-ի վրա:Հաղորդված SciFact միավորը PubMedBERT-ի fine-tuning-ից հետո
Հեղինակները նշում են F1՝ 0.63 և AUROC՝ 0.81 SciFact-ի վրա fine-tuning արված PubMedBERT-ի համար:Սրանք նախատպության մեջ հեղինակների հաղորդած արդյունքներն են: Տրամադրված ապացույցները չեն փաստում գրախոսման կամ անկախ վերարտադրման մասին:
03
Ինչ է հաղորդում նախատպությունն ընդհանուր լեզվական առաջադրանքների մասին
Վարուն Տեջա Չունդրուն և Դեբասմիտա Բիսվասը հրապարակել են «Domain-Specific Hallucination Detection in Large Language Models» հոդվածը որպես arXiv-ի 1 տարբերակ: Սեղմագիրը ներկայացնում է փուլային համակարգը և ընդհանուր տիրույթի բենչմարքերի արդյունքները որպես հեղինակների սեփական բացահայտումներ: [1]
Առաջադրանքների մակարդակով տարբերությունը կարևոր է այդ արդյունքները կենսաբժշկական տեղափոխման հետ համեմատելիս. նույնիսկ HaluEval-ի շրջանակում հաղորդված F1-ը տատանվում է ըստ պատասխանի տեսակի: Տրամադրված փաստերը չեն պարունակում բավարար մեթոդաբանական մանրամասներ՝ պարզելու, թե ինչպես կվերարտադրվեին արդյունքներն այլ արձանագրության դեպքում: [1]
- Հեղինակները նկարագրում են պատասխանի մակարդակով փուլային համակարգ (pipeline), որն օգտագործում է fine-tuning արված DeBERTa-v3 դասակարգում, Monte Carlo Dropout անորոշության գնահատում և ջերմաստիճանային սանդղակավորմամբ տրամաչափարկում (temperature-scaled calibration):
- Ընդհանուր տիրույթի առաջադրանքներում նրանք նշում են HaluEval-ի համախառն F1՝ 0.915 և AUROC՝ 0.977:
- HaluEval-ի նրանց հաղորդած F1 միավորներն են՝ 0.97 հարցուպատասխանի, 0.96 ամփոփման և 0.82 երկխոսության համար: Նրանք նաև նշում են 93.2% ճշգրտություն MC Dropout-ով եզրահանգման (inference) դեպքում:
04
Ինչ է հաղորդվում կենսաբժշկական տեղափոխման մասին
Տեղափոխման հարցի ուղղակի պատասխանն այն է, որ հոդվածն արձանագրում է ավելի ցածր միավոր միջոլորտային փորձարկման ժամանակ: Հեղինակները հայտնում են, որ ընդհանուր տիրույթի ուսուցումը SciFact-ում հասել է F1՝ 0.52-ի, ինչը նրանք բնութագրում են որպես թույլ տեղափոխում կենսաբժշկական բենչմարք: [1]
Այնուհետև նրանք նշում են ավելի բարձր F1 SciFact-ի վրա fine-tuning արված PubMedBERT-ի համար: Այս համեմատությունը համահունչ է այն մտքին, որ ոլորտային fine-tuning-ն օգնում է հոդվածի բենչմարքային միջավայրում, սակայն այն ինքնին չի հաստատում տարբերության պատճառը կամ ցույց տալիս, որ նույն մոտեցումը կաշխատի այլ կենսաբժշկական տվյալների շտեմարաններում: [1]
- Ընդհանուր տիրույթի ուսուցում՝ գնահատված SciFact-ում. հեղինակները նշում են F1՝ 0.52:
- SciFact-ի վրա fine-tuning արված PubMedBERT. հեղինակները նշում են F1՝ 0.63 և AUROC՝ 0.81:
- Նախատպությունը ոլորտին համապատասխանող նախնական ուսուցումը բնութագրում է որպես հարմարեցման ամենաուժեղ ռազմավարություն, սակայն դա հեղինակների եզրակացությունն է՝ հիմնված իրենց գնահատման վրա:
05
Գեներատորի առանձին փորձարկում
Բացի հայտնաբերումից, նախատպությունը նշում է դետեկտորի կիրառման մասին մի փորձում, որը ներառում է Direct Preference Optimization (DPO) Qwen2.5-0.5B գեներատորի վրա: Հեղինակներն ասում են, որ գեներատորի հալյուցինացիաների մակարդակն իրենց դետեկտորի տվյալներով նվազել է 85.5%-ից մինչև 37.7%: [1]
Այդ փորձն ընդլայնում է հոդվածի շրջանակը դետեկտորների պարզ համեմատությունից այն կողմ, սակայն այն պետք է մեկնաբանել զգուշությամբ: Քանի որ տրամադրված նյութերում նշվում է, որ արդյունքը չափել է հենց հեղինակների դետեկտորը, այն չի կարող անկախ կերպով փաստել, որ նշված նվազումը տարածելի է այլ գնահատիչի, մոդելի, տվյալների շտեմարանի կամ իրական կիրառման վրա: [1]
- Հեղինակները նշում են Direct Preference Optimization-ի կիրառման մասին Qwen2.5-0.5B-ի վրա:
- Նրանք հայտնում են հալյուցինացիաների չափված մակարդակի փոփոխության մասին՝ 85.5%-ից մինչև 37.7%, ինչը 55.9% հարաբերական նվազում է:
- Այդ արդյունքը չափելու համար կիրառվել է նույն դետեկտորը, ուստի հաղորդված նվազումը գեներատորի փոփոխության անկախ վավերացում չէ:
06
Ինչ կարող են ընթերցողները քաղել այս նյութից
Հասանելի փաստերը թույլ են տալիս անել զուսպ եզրահանգում. այս նախատպությունը հայտնում է իր ընդհանուր տիրույթի HaluEval արդյունքների և SciFact տեղափոխման միջև նշանակալի տարբերության մասին՝ SciFact-ի վրա fine-tuning արված մոդելի համար ավելի բարձր միավորի հետ մեկտեղ: [1]
Այն չի սահմանում ոլորտային տեղափոխման համընդհանուր կանոն կամ ներդրմանը պատրաստ լուծում: Նմանատիպ համակարգեր դիտարկող մասնագետներին անհրաժեշտ կլինի ոլորտային գնահատում և անկախ չափում՝ նախքան ավելի վստահ եզրակացություններ անելը: [1]
- Ընդհանուր տիրույթի բենչմարքերի միավորները բավարար ապացույց չեն մասնագիտացված ոլորտներում հուսալիության համար:
- SciFact-ի համեմատությունը հիմնավորում է թիրախային ոլորտում թեստավորում իրականացնելու անհրաժեշտությունը՝ նախքան արդյունավետության վերաբերյալ որոշումներ կայացնելը:
- Նյութերը չեն սահմանում լավագույն դետեկտորը, մոդելը կամ ուսուցման ռազմավարությունը կենսաբժշկական ընդհանուր կիրառման համար:
07
Ինչպես դիտարկել և կիրառել արդյունքը
Հաղորդված միավորները դիտարկեք որպես կոնկրետ բենչմարքերի վրա հիմնված հետազոտական ազդակ, այլ ոչ թե համակարգի ներդրման վավերացում:
- 01
Նախքան ընդհանուր տիրույթի գնահատականներին ապավինելը, դետեկտորը փորձարկեք թիրախային ոլորտի, պատասխանի տեսակի և նախատեսված կիրառմանը համապատասխանող բենչմարքային արձանագրության համատեքստում:
- 02
Ստուգեք ուսուցման և թեստային բաժանումները, բազային մոդելները, սխալների տեսակները, տրամաչափարկումը (calibration), հապաղումը (latency) և անորոշությունը: Տրամադրված նյութը բավարար մանրամասներ չի պարունակում այս կետերը գնահատելու համար:
- 03
Qwen-ի արդյունքը մի դիտարկեք որպես անկախ ապացույց, որ DPO-ն ընդհանուր առմամբ նվազեցնում է հալյուցինացիաները, քանի որ հաղորդված արդյունքը չափվել է հենց հեղինակների դետեկտորով:
08
Այս թողարկման սահմանափակումները
Հասանելի տվյալներն arXiv-ի 1 տարբերակից են, որը ներկայացվել է 2026 թ. սեպտեմբերի 10-ին: Այն չի փաստում գրախոսման, որևէ գիտաժողովում ընդունման, հետագա ուղղումների կամ անկախ վերարտադրման մասին: [1]
Տրամադրված նյութը չի տալիս տվյալների բաժանման (splits) հստակ մանրամասները, բազային մոդելները, իրականացման տվյալները, վիճակագրական անորոշությունը, հապաղումը կամ ներդրման ծախսերը, որոնք անհրաժեշտ են հաղորդված ցուցանիշներն ամբողջությամբ գնահատելու համար: [1]
Թեև սեղմագրում նշվում է, որ կոդը և մոդելները հասանելի են կցված պահոցում (repository), այդ պահոցը չի դիտարկվել որպես առաջնային աղբյուր. դրա բովանդակությունն ու վերարտադրելիության ապահովումն անհայտ են: [1]
Նյութերը չեն հաստատում համակարգի աշխատանքը HaluEval-ից և SciFact-ից դուրս, նշվածներից բացի այլ մոդելների վրա կամ իրական աշխատանքային միջավայրերում: [1]
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:


