Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchLos modelos de IA Claude de Anthropic ocupan las primeras posiciones en todas las variantes principales del benchmark de programación SWE-bench a fecha de septiembre de 2026, con Claude Opus 5 alcanzando un 96% en SWE-bench Verified y Claude Fable 5.1 obteniendo un 81,2% en el más exigente SWE-bench Pro. Los resultados subrayan la creciente ventaja de Anthropic en la ingeniería de software asistida por IA, incluso mientras sus rivales de OpenAI y Google Alphabet Inc. siguen recortando distancias en otros frentes.benchlm+2
SWE-bench, creado por investigadores de la Universidad de Princeton, evalúa si los modelos de IA pueden resolver problemas reales de GitHub generando parches que superen tanto las suites de pruebas nuevas como las existentes. En SWE-bench Verified, un subconjunto curado de 500 problemas, Claude Opus 5 lidera con un 96%, seguido por Claude Mythos 5 con un 95,5% y Claude Fable 5 con un 95%. En SWE-bench Pro, que abarca 1.865 problemas en 41 repositorios y evalúa tareas de ingeniería a largo plazo, Claude Fable 5.1 encabeza la clasificación con un 81,2%.benchlm+4
La trayectoria ha sido meteórica. A principios de 2025, el modelo Claude 3.5 Sonnet de Anthropic obtuvo un 49% en SWE-bench Verified. A finales de 2025, Claude Sonnet 4.5 alcanzó el 77,2%. Claude Opus 4.5 elevó esa cifra al 80,9% a principios de 2026, y cada generación de modelos posterior (Opus 4.7, Opus 4.8, Mythos y las familias Opus 5 y Fable 5) amplió aún más la ventaja.dev+5
El dominio de Anthropic en SWE-bench se produce en medio de una intensa carrera armamentística en la programación con IA. Cognition, la startup detrás del asistente de programación Devin, acaba de recaudar 2.000 millones de dólares con una valoración de 48.000 millones, con unos ingresos anualizados que han pasado de 492 a 900 millones de dólares en cuatro meses. Amazon Web Services, de Amazon.com, Inc. , está promocionando su herramienta de programación Kiro entre estudiantes de 132 universidades de todo el mundo. GPT-5.6 Sol de OpenAI, su último buque insignia, se ha igualado a Claude en algunos benchmarks generales, pero se queda atrás en tareas de programación con agentes, obteniendo un 37,3% en Terminal-Bench 4.0 frente al 55,8% de Fable 5.1.techcrunch+3
No todo el mundo considera definitivas las puntuaciones de SWE-bench. Una investigación publicada en arXiv descubrió que los mejores modelos podían identificar rutas de archivos con errores con una precisión de hasta el 76% utilizando solo las descripciones de los problemas, lo que plantea dudas sobre si los modelos razonan realmente o si dependen parcialmente de patrones en los datos. La propia Anthropic ha desplazado sus benchmarks principales para los modelos más nuevos hacia tareas con agentes a más largo plazo como Terminal-Bench, donde Fable 5.1 duplicó con creces la puntuación de su predecesor en problemas de investigación científica. La empresa ni siquiera destacó una nueva cifra de SWE-bench para Fable 5.1, lo que sugiere que incluso Anthropic considera que el benchmark se acerca a la saturación en su nivel superior.arxiv+2