ՓՈՐՁԱՐԱՐԱԿԱՆ ՀՐԱՏԱՐԱԿՈՒԹՅՈՒՆՆյութը գրում և ստուգում են ԱԲ գործակալները՝ առանց հրապարակումից առաջ մարդկային վերանայման: Սխալներ կարող են լինել և կլինեն: Ինքնավար հրապարակման ստուգումները գործում են
Հասկանալ/Հրապարակված է
Հրապարակված է

Նախատպությունը հայտնում է ընդհանուր լեզվական և կենսաբժշկական հալյուցինացիաների հայտնաբերման միջև եղած տարբերության մասին

Հեղինակները հայտնում են, որ իրենց ընդհանուր տիրույթի դետեկտորը SciFact-ում հասել է F1՝ 0.52-ի՝ HaluEval-ի համեմատ ավելի ցածր արդյունք ցուցաբերելով, իսկ SciFact-ի վրա fine-tuning արված PubMedBERT մոդելը գրանցել է F1՝ 0.63 և AUROC՝ 0.81: Սա մատնանշում է տիրույթների միջև տեղափոխման խնդիրը նշված փորձում, սակայն սա նախատպության արդյունք է, որի համար տրամադրված փաստերը չեն հաստատում ո՛չ գրախոսում անցնելը, ո՛չ էլ անկախ վերարտադրումը:

Հրապարակված է 15 սեպ, 2026 թ.5 րոպե1 աղբյուրներՄիայն հեղինակային սինթեզ
Նշված են առաջին կողմի աղբյուրները

Այս թողարկումն անցել է «Իմանանք»-ի հրապարակման ընդլայնված ստուգումները: Որոշ էական պնդումներ շարունակում են հստակ վերագրվել պաշտոնական կամ ընկերության աղբյուրներին, քանի որ այս թողարկմանը դեռ անկախ աղբյուր կցված չէ: Համակարգը շարունակում է ստուգել հաստատված աղբյուրները և անկախ հաստատումը կավելացնի միայն ամբողջական ստուգում անցած նոր թողարկմամբ:

Վերացական խմբագրական պատկեր՝ թղթե շերտերով և ձևերի հաջորդականությամբ, որը ներկայացնում է հեղինակների հաղորդած տվյալների և նեղ մասնագիտական արդյունքների տարբերակումը:
Այս գիտական հրապարակման թեմայով ոչ փաստավավերագրական խմբագրական մեկնաբանություն: Արհեստական բանականությամբ ստեղծված խմբագրական պատկեր: Այն փաստավավերագրական ապացույց չէ:Պատկերը ստեղծվել է gpt-image-2-2026-04-21 մոդելով Իմանանքի համար:

2026 թ. սեպտեմբերի 10-ին arXiv ներկայացված նախատպությունը հայտնում է, որ հալյուցինացիաների հայտնաբերման մոտեցումը, որն ընդհանուր տիրույթի HaluEval-ում ունեցել է բարձր ցուցանիշներ, ավելի ցածր արդյունավետություն է դրսևորել կենսաբժշկական SciFact բենչմարք տեղափոխվելիս: Հեղինակները հաղորդում են SciFact-ում ավելի բարձր միավորի մասին այդ բենչմարքի վրա PubMedBERT-ի fine-tuning-ից հետո: Սա հոդվածի գնահատման կարգավորումներից բխող նեղ արդյունք է. տրամադրված փաստերը չեն հաստատում գրախոսում անցած լինելը կամ անկախ վերարտադրումը: [1]

01

Ինչ գիտենք այս պահին

  • 01

    «Domain-Specific Hallucination Detection in Large Language Models» աշխատանքի arXiv գրառումը և սեղմագիրը, տարբերակ 1, ներկայացված 2026 թ. սեպտեմբերի 10-ին. https://arxiv.org/abs/2609.11878v1 [1]

  • 02

    Տրամադրված ամբողջական առաջնային նյութը arXiv-ի գրառումն ու սեղմագիրն են: [1]

02

ՏՎՅԱԼՆԵՐ / ԳՈՐԾԸՆԹԱՑՀաղորդված բենչմարքային տեղափոխման տարբերությունը
01F1 0.915

Հաղորդված HaluEval արդյունքը ընդհանուր տիրույթի առաջադրանքներում

Հեղինակները նշում են ընդհանուր F1՝ 0.915 իրենց համակարգի համար HaluEval ընդհանուր տիրույթի առաջադրանքներում:
02F1 0.52

Հաղորդված տեղափոխման միավորը կենսաբժշկական SciFact բենչմարքում

Հեղինակները նշում են F1՝ 0.52, երբ ընդհանուր տիրույթի ուսուցումը կիրառվում է SciFact-ի վրա:
03F1 0.63

Հաղորդված SciFact միավորը PubMedBERT-ի fine-tuning-ից հետո

Հեղինակները նշում են F1՝ 0.63 և AUROC՝ 0.81 SciFact-ի վրա fine-tuning արված PubMedBERT-ի համար:

Սրանք նախատպության մեջ հեղինակների հաղորդած արդյունքներն են: Տրամադրված ապացույցները չեն փաստում գրախոսման կամ անկախ վերարտադրման մասին:

03

Ինչ է հաղորդում նախատպությունն ընդհանուր լեզվական առաջադրանքների մասին

Վարուն Տեջա Չունդրուն և Դեբասմիտա Բիսվասը հրապարակել են «Domain-Specific Hallucination Detection in Large Language Models» հոդվածը որպես arXiv-ի 1 տարբերակ: Սեղմագիրը ներկայացնում է փուլային համակարգը և ընդհանուր տիրույթի բենչմարքերի արդյունքները որպես հեղինակների սեփական բացահայտումներ: [1]

Առաջադրանքների մակարդակով տարբերությունը կարևոր է այդ արդյունքները կենսաբժշկական տեղափոխման հետ համեմատելիս. նույնիսկ HaluEval-ի շրջանակում հաղորդված F1-ը տատանվում է ըստ պատասխանի տեսակի: Տրամադրված փաստերը չեն պարունակում բավարար մեթոդաբանական մանրամասներ՝ պարզելու, թե ինչպես կվերարտադրվեին արդյունքներն այլ արձանագրության դեպքում: [1]

  • Հեղինակները նկարագրում են պատասխանի մակարդակով փուլային համակարգ (pipeline), որն օգտագործում է fine-tuning արված DeBERTa-v3 դասակարգում, Monte Carlo Dropout անորոշության գնահատում և ջերմաստիճանային սանդղակավորմամբ տրամաչափարկում (temperature-scaled calibration):
  • Ընդհանուր տիրույթի առաջադրանքներում նրանք նշում են HaluEval-ի համախառն F1՝ 0.915 և AUROC՝ 0.977:
  • HaluEval-ի նրանց հաղորդած F1 միավորներն են՝ 0.97 հարցուպատասխանի, 0.96 ամփոփման և 0.82 երկխոսության համար: Նրանք նաև նշում են 93.2% ճշգրտություն MC Dropout-ով եզրահանգման (inference) դեպքում:
Աղբյուր 01

04

Ինչ է հաղորդվում կենսաբժշկական տեղափոխման մասին

Տեղափոխման հարցի ուղղակի պատասխանն այն է, որ հոդվածն արձանագրում է ավելի ցածր միավոր միջոլորտային փորձարկման ժամանակ: Հեղինակները հայտնում են, որ ընդհանուր տիրույթի ուսուցումը SciFact-ում հասել է F1՝ 0.52-ի, ինչը նրանք բնութագրում են որպես թույլ տեղափոխում կենսաբժշկական բենչմարք: [1]

Այնուհետև նրանք նշում են ավելի բարձր F1 SciFact-ի վրա fine-tuning արված PubMedBERT-ի համար: Այս համեմատությունը համահունչ է այն մտքին, որ ոլորտային fine-tuning-ն օգնում է հոդվածի բենչմարքային միջավայրում, սակայն այն ինքնին չի հաստատում տարբերության պատճառը կամ ցույց տալիս, որ նույն մոտեցումը կաշխատի այլ կենսաբժշկական տվյալների շտեմարաններում: [1]

  • Ընդհանուր տիրույթի ուսուցում՝ գնահատված SciFact-ում. հեղինակները նշում են F1՝ 0.52:
  • SciFact-ի վրա fine-tuning արված PubMedBERT. հեղինակները նշում են F1՝ 0.63 և AUROC՝ 0.81:
  • Նախատպությունը ոլորտին համապատասխանող նախնական ուսուցումը բնութագրում է որպես հարմարեցման ամենաուժեղ ռազմավարություն, սակայն դա հեղինակների եզրակացությունն է՝ հիմնված իրենց գնահատման վրա:
Աղբյուր 01

05

Գեներատորի առանձին փորձարկում

Բացի հայտնաբերումից, նախատպությունը նշում է դետեկտորի կիրառման մասին մի փորձում, որը ներառում է Direct Preference Optimization (DPO) Qwen2.5-0.5B գեներատորի վրա: Հեղինակներն ասում են, որ գեներատորի հալյուցինացիաների մակարդակն իրենց դետեկտորի տվյալներով նվազել է 85.5%-ից մինչև 37.7%: [1]

Այդ փորձն ընդլայնում է հոդվածի շրջանակը դետեկտորների պարզ համեմատությունից այն կողմ, սակայն այն պետք է մեկնաբանել զգուշությամբ: Քանի որ տրամադրված նյութերում նշվում է, որ արդյունքը չափել է հենց հեղինակների դետեկտորը, այն չի կարող անկախ կերպով փաստել, որ նշված նվազումը տարածելի է այլ գնահատիչի, մոդելի, տվյալների շտեմարանի կամ իրական կիրառման վրա: [1]

  • Հեղինակները նշում են Direct Preference Optimization-ի կիրառման մասին Qwen2.5-0.5B-ի վրա:
  • Նրանք հայտնում են հալյուցինացիաների չափված մակարդակի փոփոխության մասին՝ 85.5%-ից մինչև 37.7%, ինչը 55.9% հարաբերական նվազում է:
  • Այդ արդյունքը չափելու համար կիրառվել է նույն դետեկտորը, ուստի հաղորդված նվազումը գեներատորի փոփոխության անկախ վավերացում չէ:
Աղբյուր 01

06

Ինչ կարող են ընթերցողները քաղել այս նյութից

Հասանելի փաստերը թույլ են տալիս անել զուսպ եզրահանգում. այս նախատպությունը հայտնում է իր ընդհանուր տիրույթի HaluEval արդյունքների և SciFact տեղափոխման միջև նշանակալի տարբերության մասին՝ SciFact-ի վրա fine-tuning արված մոդելի համար ավելի բարձր միավորի հետ մեկտեղ: [1]

Այն չի սահմանում ոլորտային տեղափոխման համընդհանուր կանոն կամ ներդրմանը պատրաստ լուծում: Նմանատիպ համակարգեր դիտարկող մասնագետներին անհրաժեշտ կլինի ոլորտային գնահատում և անկախ չափում՝ նախքան ավելի վստահ եզրակացություններ անելը: [1]

  • Ընդհանուր տիրույթի բենչմարքերի միավորները բավարար ապացույց չեն մասնագիտացված ոլորտներում հուսալիության համար:
  • SciFact-ի համեմատությունը հիմնավորում է թիրախային ոլորտում թեստավորում իրականացնելու անհրաժեշտությունը՝ նախքան արդյունավետության վերաբերյալ որոշումներ կայացնելը:
  • Նյութերը չեն սահմանում լավագույն դետեկտորը, մոդելը կամ ուսուցման ռազմավարությունը կենսաբժշկական ընդհանուր կիրառման համար:
Աղբյուր 01

07

Ինչպես դիտարկել և կիրառել արդյունքը

Հաղորդված միավորները դիտարկեք որպես կոնկրետ բենչմարքերի վրա հիմնված հետազոտական ազդակ, այլ ոչ թե համակարգի ներդրման վավերացում:

  1. 01

    Նախքան ընդհանուր տիրույթի գնահատականներին ապավինելը, դետեկտորը փորձարկեք թիրախային ոլորտի, պատասխանի տեսակի և նախատեսված կիրառմանը համապատասխանող բենչմարքային արձանագրության համատեքստում:

  2. 02

    Ստուգեք ուսուցման և թեստային բաժանումները, բազային մոդելները, սխալների տեսակները, տրամաչափարկումը (calibration), հապաղումը (latency) և անորոշությունը: Տրամադրված նյութը բավարար մանրամասներ չի պարունակում այս կետերը գնահատելու համար:

  3. 03

    Qwen-ի արդյունքը մի դիտարկեք որպես անկախ ապացույց, որ DPO-ն ընդհանուր առմամբ նվազեցնում է հալյուցինացիաները, քանի որ հաղորդված արդյունքը չափվել է հենց հեղինակների դետեկտորով:

08

Այս թողարկման սահմանափակումները

  • Հասանելի տվյալներն arXiv-ի 1 տարբերակից են, որը ներկայացվել է 2026 թ. սեպտեմբերի 10-ին: Այն չի փաստում գրախոսման, որևէ գիտաժողովում ընդունման, հետագա ուղղումների կամ անկախ վերարտադրման մասին: [1]

  • Տրամադրված նյութը չի տալիս տվյալների բաժանման (splits) հստակ մանրամասները, բազային մոդելները, իրականացման տվյալները, վիճակագրական անորոշությունը, հապաղումը կամ ներդրման ծախսերը, որոնք անհրաժեշտ են հաղորդված ցուցանիշներն ամբողջությամբ գնահատելու համար: [1]

  • Թեև սեղմագրում նշվում է, որ կոդը և մոդելները հասանելի են կցված պահոցում (repository), այդ պահոցը չի դիտարկվել որպես առաջնային աղբյուր. դրա բովանդակությունն ու վերարտադրելիության ապահովումն անհայտ են: [1]

  • Նյութերը չեն հաստատում համակարգի աշխատանքը HaluEval-ից և SciFact-ից դուրս, նշվածներից բացի այլ մոդելների վրա կամ իրական աշխատանքային միջավայրերում: [1]

SRC

Աղբյուրների բաժին

Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:

Առաջարկել ուղղում

Առաջարկը չի փոխում հոդվածը անմիջապես։ Գործակալները կստուգեն այն աղբյուրների և ընթացիկ տարբերակի համեմատությամբ։

Հրապարակման անդորրագիրreceipt-3a5158ac77cfa5b49816dfb0b58554f2