Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

anthropic+1siliconangle+1xenaproject.wordpressAnthropic anunció el jueves que su modelo de IA Claude ha completado la primera prueba integral, verificada por computadora, del Último Teorema de Fermat, uno de los resultados más célebres de las matemáticas. Trabajando de manera mayormente autónoma durante 11 días, Claude escribió la prueba en el lenguaje de programación Lean, produciendo 13 millones de líneas de código y demostrando 29,500 teoremas intermedios en el proceso.anthropic+1
El Último Teorema de Fermat establece que ningún número entero positivo a, b y c satisface la ecuación aⁿ + bⁿ = cⁿ para cualquier entero n mayor que 2. Conjeturado por primera vez por Pierre de Fermat alrededor de 1637, no fue probado hasta 1995, cuando Andrew Wiles publicó una prueba de 129 páginas que requirió meses de revisión por parte de expertos para ser verificada.anthropic
Se esperaba que formalizar esa prueba, es decir, reescribirla para que una computadora pudiera verificar cada paso lógico, tomara años. Kevin Buzzard, matemático del Imperial College de Londres que ha liderado un esfuerzo independiente para formalizar el teorema usando Lean, confirmó que el código compila y es correcto. En una entrada de blog el viernes, Buzzard lo calificó como un "logro extraordinario de autoformalización" y señaló que la prueba es "multicapa", abarcando álgebra, análisis armónico, geometría y teoría de números.xenaproject.wordpress+1
La prueba de Claude sigue la exposición de Darmon-Diamond-Taylor del argumento de Wiles-Taylor-Wiles, una versión simplificada de la prueba original. La intervención humana se limitó a instrucciones ocasionales de alto nivel del investigador de Anthropic, Tianyi Peng, cuyo equipo en la Universidad de Columbia construyó la plataforma Prove2Me que permitió el esfuerzo.anthropic+1
Varios intentos iniciales fracasaron cuando los agentes de Claude perdieron el rastro del estado del proyecto y dejaron de colaborar eficazmente. El avance se produjo cuando el equipo cambió a Prove2Me, una plataforma colaborativa abierta que mantiene un grafo dirigido de declaraciones de teoremas, permitiendo que múltiples agentes trabajen en paralelo y decidan qué pruebas intentar a continuación. Utilizando un sistema multiagente basado en Claude Code, docenas de agentes consumieron aproximadamente seis mil millones de tokens de salida de un modelo de investigación interno que Anthropic describe como comparable a Claude Fable 5.1.siliconangle+1
La prueba final fue verificada por Lean utilizando solo sus tres axiomas estándar, y un comparador confirmó que la declaración del teorema coincide con la propia formulación del teorema en Mathlib. Con 13 millones de líneas, es más de cinco veces el tamaño de Mathlib, la principal biblioteca comunitaria de matemáticas formalizadas.anthropic+1
Buzzard, a quien le enviaron un correo electrónico sobre el resultado mientras estaba en un festival de música y descartó al remitente como un loco, escribió que el logro marca una nueva era: "Si la formalización automática del teorema es posible ahora, entonces hemos dado un gran paso hacia la formalización automática de la literatura matemática moderna". Señaló que tales técnicas podrían eliminar errores en el corpus matemático existente y aligerar la carga de los revisores que evalúan nuevos trabajos.anthropic+1
El hito sigue a una serie de avances en matemáticas impulsados por la IA. Anthropic utilizó a Claude el mes pasado para descubrir nueva información sobre la función zeta de Riemann, mientras que su rival OpenAI utilizó su modelo más reciente para resolver varios problemas de Erdős. Anthropic también utilizó recientemente a Claude para refutar la conjetura jacobiana en tres dimensiones y superiores. Buzzard, por su parte, hizo un comentario característicamente seco: "Me dieron 1 millón de libras para ejecutar mi proyecto durante 5 años; Anthropic solo tardó 11 días, pero me pregunto si gastaron más dinero".xenaproject.wordpress+2