Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechai+1chaincatcher+1El próximo modelo Astra de OpenAI utiliza una técnica arquitectónica llamada "profundidad recurrente" que permite al modelo procesar información a través de las mismas capas de la red neuronal varias veces antes de generar una respuesta. Esto mejora el rendimiento, pero oculta el razonamiento en el que confían los investigadores de seguridad para supervisar los sistemas de IA de frontera. La revelación, reportada inicialmente por The Information, ha desatado una ola de preocupación entre los investigadores de seguridad de la IA, quienes ven la supervisión de la cadena de pensamiento como una de las pocas herramientas disponibles para verificar si los modelos potentes se comportan como se espera.theinformation
Los modelos de razonamiento tradicionales redactan su pensamiento intermedio en forma de texto legible, una "cadena de pensamiento" que los humanos pueden inspeccionar. En cambio, la profundidad recurrente refina una representación numérica interna a lo largo de múltiples pasadas por las mismas capas de transformadores, produciendo lo que los investigadores llaman "neuralés" (un razonamiento matemático comprimido que nunca se traduce al lenguaje humano). Según se informa, esta técnica mejora el rendimiento en matemáticas y programación, al tiempo que reduce el coste computacional de generar cientos de palabras adicionales de razonamiento visible.officechai+1
El precio a pagar es la transparencia. El investigador de seguridad de la IA Ryan Greenblatt calificó la transición hacia este tipo de razonamiento opaco como potencialmente uno de los peores avances para la seguridad de la IA, ya que elimina una ventana al pensamiento del modelo en la que los investigadores confiaban para detectar comportamientos engañosos o no autorizados. Gary Marcus, en su boletín de Substack, lo calificó de "línea roja de seguridad", argumentando que sacrificar la legibilidad de la cadena de pensamiento a cambio de mejoras de rendimiento es "un juego peligroso".garymarcus.substack+1
Jakub Pachocki, director de investigación de OpenAI, respondió en X afirmando que quería "evitar una carrera hacia la falta de supervisión iniciada por informaciones confusas". Argumentó que la profundidad del gráfico de computación de Astra está dentro de un factor de dos respecto a la de GPT-4, y que OpenAI ha "trabajado para preservar y utilizar la supervisión de la cadena de pensamiento" desde sus primeros modelos de razonamiento. Sin embargo, admitió que la supervisión de la cadena de pensamiento "es frágil y, por desgracia, muestra una tendencia negativa".chaincatcher+1
Según se informa, OpenAI ha limitado la medida en que Astra utiliza la profundidad recurrente para preservar un resultado de razonamiento legible y planea implementar medidas de supervisión adicionales en su lanzamiento. La empresa confirmó el 31 de agosto que Astra es su primer modelo en alcanzar el umbral de capacidad de ciberseguridad "Crítica" bajo su Marco de Preparación, lo que significa que puede descubrir y explotar de forma autónoma vulnerabilidades de día cero.kucoin+2
Este desarrollo ha llamado especialmente la atención porque refleja fielmente un escenario descrito en el ensayo "AI 2027", publicado en abril de 2025 por el exinvestigador de OpenAI Daniel Kokotajlo y otros coautores. Ese ensayo predecía una transición hacia la "recurrencia en neuralés" que sacaría el razonamiento del modelo del texto legible, pero lo situaba para marzo de 2027 y asumía que requeriría miles de investigadores de IA automatizados para lograrse. Kokotajlo reaccionó a la noticia publicando en redes sociales: "Madre mía, joder". Si la información de The Information es correcta, una versión del escenario sobre el que advirtió podría llegar en un producto comercial unos 18 meses antes de lo previsto.officechai