Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunch2026 թվականի սեպտեմբերի դրությամբ Anthropic-ի Claude AI մոդելները գլխավորում են SWE-bench կոդավորման վարկանիշային աղյուսակի բոլոր հիմնական տարբերակները. Claude Opus 5-ը SWE-bench Verified-ում հասել է 96%-ի, իսկ Claude Fable 5.1-ը ավելի պահանջկոտ SWE-bench Pro-ում վաստակել է 81.2%: Արդյունքներն ընդգծում են Anthropic-ի ընդլայնվող առաջատարությունը AI-ով աջակցվող ծրագրային ինժեներիայում, նույնիսկ այն դեպքում, երբ OpenAI-ի և Google Alphabet Inc.-ի մրցակիցները շարունակում են կրճատել բացը այլ ոլորտներում:benchlm+2
Փրինսթոնի համալսարանի հետազոտողների կողմից ստեղծված SWE-bench-ը ստուգում է, թե արդյոք AI մոդելները կարող են լուծել GitHub-ի իրական խնդիրները՝ ստեղծելով փաթչեր, որոնք անցնում են ինչպես նոր, այնպես էլ գոյություն ունեցող թեստային հավաքածուները: 500 խնդիրներից բաղկացած SWE-bench Verified-ում Claude Opus 5-ը առաջատար է 96%-ով, որին հաջորդում են Claude Mythos 5-ը (95.5%) և Claude Fable 5-ը (95%): SWE-bench Pro-ում, որն ընդգրկում է 1865 խնդիր 41 պահոցներից և ստուգում է ավելի երկարաժամկետ ինժեներական առաջադրանքներ, Claude Fable 5.1-ը գլխավորում է աղյուսակը 81.2%-ով:benchlm+4
Աճի տեմպերը կտրուկ են եղել: 2025 թվականի սկզբին Anthropic-ի Claude 3.5 Sonnet-ը SWE-bench Verified-ում վաստակել էր 49%: 2025 թվականի վերջին Claude Sonnet 4.5-ը հասավ 77.2%-ի: Claude Opus 4.5-ը 2026 թվականի սկզբին այդ ցուցանիշը հասցրեց 80.9%-ի, և յուրաքանչյուր հաջորդ սերունդ՝ Opus 4.7, Opus 4.8, Mythos, ինչպես նաև Opus 5 և Fable 5 ընտանիքները, ավելի ամրապնդեցին այդ առաջատարությունը:dev+5
SWE-bench-ում Anthropic-ի գերիշխանությունը տեղի է ունենում AI կոդավորման ինտենսիվ մրցավազքի պայմաններում: Cognition ստարտափը, որը կանգնած է Devin կոդավորման օգնականի հետևում, 48 միլիարդ դոլար գնահատմամբ 2 միլիարդ դոլար է ներգրավել, իսկ նրա տարեկան եկամուտը չորս ամսում 492 միլիոնից հասել է 900 միլիոն դոլարի: Amazon Web Services Amazon.com, Inc. -ը իր Kiro կոդավորման գործիքը առաջարկում է աշխարհի 132 համալսարանների ուսանողներին: OpenAI-ի վերջին ֆլագմանը՝ GPT-5.6 Sol-ը, որոշ ընդհանուր թեստերում հավասարվել է Claude-ին, սակայն հետ է մնում գործակալային կոդավորման առաջադրանքներում՝ Terminal-Bench 4.0-ում վաստակելով 37.3%, մինչդեռ Fable 5.1-ի ցուցանիշը 55.8% է:techcrunch+3
Ոչ բոլորն են SWE-bench-ի միավորները համարում վերջնական: arXiv-ում հրապարակված հետազոտությունը ցույց է տվել, որ լավագույն մոդելները կարող են 76% ճշգրտությամբ բացահայտել սխալ ֆայլային ուղիները՝ հիմնվելով միայն խնդրի նկարագրության վրա, ինչը հարցեր է առաջացնում այն մասին, թե արդյոք մոդելները իսկապես տրամաբանում են, թե մասամբ հիմնվում են տվյալների օրինաչափությունների վրա: Anthropic-ն ինքը նոր մոդելների համար ուշադրությունը տեղափոխել է ավելի երկարաժամկետ գործակալային առաջադրանքների վրա, ինչպիսին է Terminal-Bench-ը, որտեղ Fable 5.1-ը գիտական հետազոտական խնդիրներում կրկնապատկել է իր նախորդի արդյունքը: Ընկերությունը Fable 5.1-ի համար SWE-bench-ի նոր ցուցանիշ չի հրապարակել, ինչը հուշում է, որ նույնիսկ Anthropic-ը կարծում է, որ այս վարկանիշը մոտենում է իր սահմանին:arxiv+2