2026 թ. զեկույց
2026 թ. AI Index-ը՝ ինը կարևոր ազդակով
Փաստերի վրա հիմնված ուղեցույց՝ հնարավորությունների, ներդրման, կրթության և ենթակառուցվածքների փոփոխությունների մասին՝ չափման սահմանափակումների հաշվառմամբ:
2026 թ. AI Index զեկույցի գլխավոր միտքն այն չէ, որ բոլոր ցուցանիշներն աճում են: Հիմնական շեշտադրումն այն է, որ հնարավորությունները, ներդրումը, կրթությունն ու ենթակառուցվածքները զարգանում են տարբեր արագությամբ: Այս ինը ազդակն օգնում են տարանջատել իրական առաջընթացն առաջատարների աղյուսակի թվացյալ արդյունքներից:
01
Ինչ գիտենք այս պահին
- 01
2025 թ. զեկույցում նշված առաջատար առանցքային մոդելների ավելի քան 90 տոկոսը մշակել է արդյունաբերական հատվածը:
- 02
Մոդելների մի քանի ընտանիքներ մոտենում են հիմնական թեստերի առավելագույն ցուցանիշներին, թեև բարդ տրամաբանական, գործակալային և ֆիզիկական աշխարհի առաջադրանքներում արդյունքները մնում են անհավասարաչափ:
- 03
Տեխնոլոգիայի ներդրումն ավելի արագ է ընթանում, քան ինստիտուցիոնալ հստակ գործելակերպի ձևավորումը, հատկապես կրթության ոլորտում:
02
Ինչու է սա կարևոր Հայաստանի համար
Փոքր շուկայի համար առանցքային հարցն այն չէ, թե ով է առաջատարը համաշխարհային աղյուսակներում, այլ այն, թե այս փոփոխություններից որոնք պետք է ազդեն հմտությունների, գնահատման և հաշվողական ռեսուրսների հասանելիության վերաբերյալ որոշումների վրա:
03
արդյունաբերության մասնաբաժին
2025 թ. առանցքային առաջատար մոդելների շարքումArena Elo միավորներ
առաջատար խմբի միջակայքը 2026 թ. մարտի դրությամբփակ և բաց մոդելների տարբերություն
զեկույցի ընտրված ամփոփ ցուցանիշովանվավեր հարցեր
GSM8K-ի դիտարկված առաջադրանքներում անվավեր հարցերի գնահատված բաժինըOSWorld-ի լավագույն արդյունք
զգալի առաջընթաց, թեև առաջադրանքների մի մասը դեռ չի լուծվումիրական կենցաղային առաջադրանքներ
ռոբոտների գրանցած հաջողությունը սիմուլյացիայից դուրսներդրումը կազմակերպություններում
առնվազն մեկ գործառույթում՝ ըստ հարցված ընկերություններիտարածվածությունը բնակչության շրջանում
18-64 տարիքային խմբում երեք տարվա ընթացքումդպրոցական հստակ քաղաքականություն
ուղեցույցները հստակ համարող ուսուցիչների բաժինը հարցումներից մեկումՅուրաքանչյուր ցուցանիշ վերաբերում է կոնկրետ տվյալների բազայի ու մեթոդաբանության: Դրանցից ոչ մեկը ԱԲ որակի համընդհանուր չափանիշ չէ:
04
1. Հնարավորություններն աճում են, բայց սովորական թեստերը կորցնում են ճշգրտությունը
Սթենֆորդի HAI-ն արձանագրում է արագ տեխնիկական առաջընթացի ևս մեկ տարի: Ծրագրային ապահովման իրական խնդիրների լուծումը գնահատող SWE-bench Verified բենչմարքում լավագույն ցուցանիշը մեկ տարում շուրջ 60 տոկոսից հասել է գրեթե 100 տոկոսի: Բացի այդ, զեկույցի 2025 թ. ընտրանքում ընդգրկված առանցքային առաջատար մոդելների ավելի քան 90 տոկոսը մշակել է արդյունաբերական հատվածը:
Այս թվերը չեն նշանակում, թե ծրագրավորման խնդիրներն ամբողջությամբ լուծված են, կամ որ ոլորտի մոդելները լիովին հուսալի են: Բենչմարքը կարող է սպառվել, երբ համակարգերը յուրացնում են դրա կրկնվող կառուցվածքը, ուսուցման տվյալները համընկնում են թեստի հետ, կամ առաջադրանքներն այլևս չեն արտացոլում առօրյա կիրառությունը: Զեկույցն ամփոփում է նաև լայնորեն կիրառվող ինը բենչմարքերի վերլուծությունը, որտեղ անվավեր հարցերի գնահատված մասնաբաժինը տատանվում է MMLU Math-ի 2 տոկոսից մինչև GSM8K-ի 42 տոկոսը: Արագ առաջընթացը գնահատման մեթոդները թարմացնելու ազդակ է, ոչ թե գնահատումը դադարեցնելու պատճառ:
- Ազդակ 1. առաջատար մոդելների հնարավորությունները շարունակում են արագ աճել:
- Ազդակ 2. առաջատար մոդելների մեծ մասն այժմ ստեղծում է մասնավոր հատվածը:
- Ազդակ 3. սպառված թեստերը պահանջում են փոխարինում կամ ավելի բարդ ընդլայնումներ:
05
2. Առաջատարները մոտեցել են միմյանց, իսկ բաց մոդելների հետ տարբերությունը՝ մեծացել
2026 թ. մարտի դրությամբ զեկույցի Arena համեմատության մեջ չորս ընկերությունների մոդելներ միմյանցից գտնվում էին ընդամենը 25 Elo միավորի սահմաններում: Միևնույն ժամանակ, ամենահզոր փակ և բաց մոդելների միջև տարբերությունը կրկին հասել է 3.3 տոկոսի՝ 2024 թ. օգոստոսի 0.5 տոկոսի համեմատ: Սրանք ընթացիկ արդյունքներ են և ոչ թե վերջնական վարկանիշ, սակայն դրանք ցույց են տալիս, թե որքան արագ կարող է փոխվել մրցակցային տարածությունը:
Միավորների փոքր տարբերությունն ինքնին բավարար հիմք չէ մոդել ընտրելու համար: Արժեքը, հապաղումը (latency), լեզվական հնարավորությունները, կոնտեքստի ծավալը, տվյալների մշակումը, գործիքների կիրառումն ու սխալների բնույթը կարող են շատ ավելի վճռորոշ լինել: Երբ համակարգերի ցուցանիշները խիստ մոտ են, թեստերի ճշգրտությունն ու անորոշության գնահատումն ավելի կարևոր են դառնում, քան աղյուսակում զբաղեցրած դիրքը:
- Ազդակ 4. առաջատար մոդելների միջև տարբերությունները կրճատվել են:
- Ազդակ 5. փակ և բաց կոդով (open-weight) մոդելների միջև տարբերությունը կարճատև կրճատումից հետո կրկին մեծացել է:
06
3. Հնարավորությունները շարունակում են մնալ անհավասարաչափ
Նույն զեկույցում արձանագրված է, որ մոդելներից մեկը 2025 թ. Մաթեմատիկայի միջազգային օլիմպիադայի խնդիրներից վաստակել է 35 միավոր, մինչդեռ ժամանակի տեսողական ընկալումը ստուգող ClockBench թեստում լավագույն արդյունքը կազմել է ընդամենը 50.6 տոկոս՝ մարդու 90.1 տոկոս ցուցանիշի դիմաց: Համակարգչային միջավայրի օգտագործումը թեստավորող OSWorld-ում առաջատար միավորը բարձրացել է մինչև 66.3 տոկոս, ինչը նշանակում է, որ առաջադրանքներից գրեթե յուրաքանչյուր երրորդը դեռ մնում է չլուծված: Ֆիզիկական աշխարհում սիմուլյացիոն բարձր արդյունքների կողքին զեկույցը փաստում է իրական կենցաղային առաջադրանքներում ռոբոտների ընդամենը 12 տոկոս հաջողության մասին:
Սա հուսալիության գլխավոր դասն է. մեկ ոլորտում տպավորիչ առաջընթացն ինքնաբերաբար չի տարածվում այլ առաջադրանքների վրա: Համակարգերը կարող են հաջողությամբ լուծել բարդ ֆորմալ խնդիրներ, բայց ձախողվել ընկալման, միջերեսների կառավարման, ոչ միանշանակ հրահանգների կամ փոփոխվող միջավայրի պայմաններում:
- Ազդակ 6. տրամաբանական դատողությունն ու առօրյա ընկալումը զարգանում են անհամաչափ:
- Ազդակ 7. գործակալներն ավելի ունակ են, բայց համակարգչից սովորական օգտվելիս դեռ հաճախ են սխալվում:
- Ազդակ 8. սիմուլյացիոն հաջողությունը չի երաշխավորում նույն արդյունքն իրական միջավայրում:
07
4. Ներդրումն առաջ է անցնում հաստատված գործելակերպից
Ըստ զեկույցի գնահատականների՝ հարցված կազմակերպությունների 88 տոկոսն ԱԲ-ն կիրառում է առնվազն մեկ բիզնես գործառույթում: Միևնույն ժամանակ, հանրային հարցումների համադրությունը ցույց է տալիս, որ գեներատիվ ԱԲ-ի առաջին զանգվածային թողարկումից երեք տարի անց այն հասել է 18-64 տարիքային խմբի մոտ 53 տոկոսին: Զեկույցն ընդգծում է զգալի տարբերություններն ըստ երկրների և ուղիղ կապը մեկ շնչին ընկնող ՀՆԱ-ի հետ: ԱՄՆ կրթական համակարգում ավագ դպրոցի և բուհերի ուսանողների ավելի քան չորս հինգերորդը նշում է ուսումնական առաջադրանքների համար ԱԲ օգտագործելու մասին, մինչդեռ նշված հարցումներից մեկում ուսուցիչների միայն 6 տոկոսն է իր հաստատության կանոնները համարել հստակ:
Հետևաբար, Հայաստանի համար 9-րդ ազդակը վերաբերում է ոչ միայն տեխնոլոգիայի կիրառմանը, այլև ինստիտուցիոնալ պատրաստվածությանը: Դպրոցներին, լաբորատորիաներին, ընկերություններին ու պետական ծրագրերին անհրաժեշտ են կոնկրետ առաջադրանքների փոքր թեստեր, տվյալների օգտագործման հստակ կանոններ և բավարար հաշվողական ռեսուրսներ՝ համակարգերը տեղում փորձարկելու համար: Հասանելիություն գնելն առանց գնահատման կարողությունների զարգացման պարզապես նշանակում է որդեգրել ուրիշների մոտեցումներն ու ենթադրությունները:
- Ազդակ 9. տեխնոլոգիայի կիրառումն առաջ է անցնում ինստիտուցիոնալ փորձից:
- Մոդելները համեմատելուց առաջ պարզել, թե կոնկրետ որ առաջադրանքն է չափում տվյալ ցուցանիշը:
- Ստեղծել և պահպանել հայերեն թեստային բազա, որն արտացոլում է նախատեսված կիրառությունը:
- Արձանագրել սխալներն ու դրանց ուղղման ջանքերը, ոչ միայն միջին գնահատականները:
08
Ինչպես կարող է Հայաստանն օգտագործել այս ազդակները
Զեկույցն առավել օգտակար է, երբ օգնում է վերանայել տեղական որոշումները:
- 01
Ուսուցանել մոդելների գնահատում՝ ներառյալ անորոշության վերլուծությունն ու բենչմարքերի նախագծումը:
- 02
Մոդել ընտրելուց առաջ հայերեն առաջադրանքները փորձարկել տեղական ներկայացուցչական նյութերով:
- 03
Հաշվողական նոր ռեսուրսների տրամադրումը զուգակցել կոնկրետ առաջադրանքների թեստերով, ինչպես նաև սխալների ու դրանց ուղղման ջանքերի արձանագրմամբ:
09
Այս թողարկման սահմանափակումները
AI Index-ը համադրում է տարբեր ժամկետներում ու տարբեր մեթոդներով հավաքագրված բազմաթիվ տվյալներ:
Առաջատարների աղյուսակների դիրքերը կարող են փոխվել հրապարակումից հետո և չեն արտացոլում գործնական կիրառման բոլոր սահմանափակումները:
Հայաստանին վերաբերող եզրահանգումները «Իմանանք»-ի վերլուծությունն են և չեն հանդիսանում Սթենֆորդի HAI-ի պաշտոնական առաջարկություններ:
SRC
Աղբյուրների բաժին
Ուղիղ հղումներ այս ընտրանու հիմքում եղած նյութերին: Աղբյուրը տեսնելը նույնքան կարևոր է, որքան սինթեզն ընթերցելը:
