Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunch„Anthropic“ DI modeliai „Claude“ nuo 2026 m. rugsėjo mėn. užima aukščiausias pozicijas visuose pagrindiniuose SWE-bench programavimo testų variantuose: „Claude Opus 5“ pasiekė 96 proc. „SWE-bench Verified“ teste, o „Claude Fable 5.1“ surinko 81,2 proc. sudėtingesniame „SWE-bench Pro“ teste. Šie rezultatai pabrėžia didėjantį „Anthropic“ pranašumą DI pagrįstos programinės įrangos inžinerijos srityje, net kai konkurentai iš „OpenAI“ ir „Google Alphabet Inc.“ toliau mažina atsilikimą kitose srityse.benchlm+2
Prinstono universiteto mokslininkų sukurtas SWE-bench testas tikrina, ar DI modeliai gali išspręsti realias „GitHub“ problemas generuodami pataisas, kurios praeina tiek naujus, tiek esamus testų paketus. „SWE-bench Verified“ teste, apimančiame 500 atrinktų problemų, „Claude Opus 5“ pirmauja su 96 proc., po jo seka „Claude Mythos 5“ su 95,5 proc. ir „Claude Fable 5“ su 95 proc. „SWE-bench Pro“ teste, kuriame nagrinėjama 1 865 problemos 41 saugykloje ir tikrinamos ilgalaikės inžinerinės užduotys, „Claude Fable 5.1“ reitingų viršūnėje yra su 81,2 proc.benchlm+4
Trajektorija buvo staigi. 2025 m. pradžioje „Anthropic“ „Claude 3.5 Sonnet“ „SWE-bench Verified“ teste surinko 49 proc. Iki 2025 m. pabaigos „Claude Sonnet 4.5“ pasiekė 77,2 proc. „Claude Opus 4.5“ iki 2026 m. pradžios šį rodiklį pakėlė iki 80,9 proc., o kiekviena paskesnė modelių karta – „Opus 4.7“, „Opus 4.8“, „Mythos“ bei „Opus 5“ ir „Fable 5“ šeimos – pranašumą dar labiau padidino.dev+5
„Anthropic“ dominavimas SWE-bench vyksta intensyvėjant DI programavimo ginklavimosi varžyboms. „Cognition“, startuolis, sukūręs „Devin“ programavimo asistentą, ką tik pritraukė 2 mlrd. JAV dolerių investiciją, įvertinus įmonę 48 mlrd. JAV dolerių, o metinės pajamos per keturis mėnesius išaugo nuo 492 mln. iki 900 mln. JAV dolerių. „Amazon Web Services Amazon.com, Inc.“ savo „Kiro“ programavimo įrankį diegia 132 pasaulio universitetuose. „OpenAI“ flagmanas „GPT-5.6 Sol“ kai kuriuose bendruose testuose beveik susilygino su „Claude“, tačiau atsilieka atliekant agentines programavimo užduotis: „Terminal-Bench 4.0“ teste surinko 37,3 proc., palyginti su 55,8 proc. „Fable 5.1“ rezultatu.techcrunch+3
Ne visi SWE-bench balus laiko galutiniais. „arXiv“ paskelbtas tyrimas parodė, kad geriausi modeliai gali nustatyti klaidingus failų kelius iki 76 proc. tikslumu naudodami tik problemų aprašymus, todėl kyla klausimų, ar modeliai iš tikrųjų mąsto, ar iš dalies remiasi duomenų modeliais. Pati „Anthropic“ savo naujesnių modelių pagrindinius testus perkėlė į ilgalaikes agentines užduotis, tokias kaip „Terminal-Bench“, kur „Fable 5.1“ mokslinių tyrimų problemų srityje savo pirmtako rezultatą pagerino daugiau nei dvigubai. Bendrovė net nepateikė naujo SWE-bench skaičiaus „Fable 5.1“ modeliui, o tai rodo, kad net „Anthropic“ mano, jog šis testas pasiekė savo ribas.arxiv+2