Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchModely umělé inteligence Claude od společnosti Anthropic drží k září 2026 první příčky ve všech hlavních variantách programovacího benchmarku SWE-bench, přičemž Claude Opus 5 dosáhl 96 % v testu SWE-bench Verified a Claude Fable 5.1 získal 81,2 % v náročnějším SWE-bench Pro. Výsledky podtrhují rostoucí náskok Anthropic v softwarovém inženýrství s podporou AI, i když konkurenti z OpenAI a Google Alphabet Inc. nadále snižují náskok v jiných oblastech.benchlm+2
Benchmark SWE-bench, vytvořený výzkumníky z Princetonské univerzity, testuje, zda modely AI dokážou řešit reálné problémy na GitHubu generováním oprav, které projdou novými i stávajícími testovacími sadami. V testu SWE-bench Verified, což je kurátorský výběr 500 problémů, vede Claude Opus 5 s 96 %, následován Claude Mythos 5 s 95,5 % a Claude Fable 5 s 95 %. V testu SWE-bench Pro, který zahrnuje 1 865 problémů ve 41 repozitářích a testuje dlouhodobější inženýrské úkoly, vede žebříček Claude Fable 5.1 s 81,2 %.benchlm+4
Trajektorie byla strmá. Na začátku roku 2025 získal model Claude 3.5 Sonnet od Anthropic 49 % v testu SWE-bench Verified. Koncem roku 2025 dosáhl Claude Sonnet 4.5 77,2 %. Claude Opus 4.5 toto skóre do začátku roku 2026 posunul na 80,9 % a každá další generace modelů – Opus 4.7, Opus 4.8, Mythos a rodiny Opus 5 a Fable 5 – náskok dále rozšířila.dev+5
Dominance Anthropic v testech SWE-bench přichází uprostřed sílících závodů ve zbrojení v oblasti AI programování. Cognition, startup stojící za programovacím asistentem Devin, právě získal 2 miliardy dolarů při ocenění 48 miliard dolarů, přičemž jeho roční tržby vzrostly během čtyř měsíců ze 492 milionů na 900 milionů dolarů. Amazon Web Services Amazon.com, Inc. prosazuje svůj programovací nástroj Kiro mezi studenty na 132 univerzitách po celém světě. Vlajková loď OpenAI, GPT-5.6 Sol, se v některých obecných benchmarcích téměř vyrovnala modelu Claude, ale v agentních programovacích úkolech zaostává, když v testu Terminal-Bench 4.0 získala 37,3 % oproti 55,8 % u Fable 5.1.techcrunch+3
Ne každý považuje skóre SWE-bench za definitivní. Výzkum publikovaný na arXiv zjistil, že špičkové modely dokážou identifikovat chybné cesty k souborům s přesností až 76 % pouze pomocí popisů problémů, což vyvolává otázky, zda modely skutečně uvažují, nebo se částečně spoléhají na vzorce v datech. Společnost Anthropic sama přesunula své hlavní benchmarky pro novější modely směrem k dlouhodobějším agentním úkolům, jako je Terminal-Bench, kde Fable 5.1 více než zdvojnásobil skóre svého předchůdce v úlohách vědeckého výzkumu. Společnost pro Fable 5.1 ani nezveřejnila nové číslo SWE-bench, což naznačuje, že i Anthropic vnímá tento benchmark jako blížící se nasycení na horní hranici.arxiv+2