Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

openai+1dailytechnologyreview+1OpenAI presentó el martes GPT-Red, un sistema interno de red-teaming automatizado que utiliza el auto-juego para descubrir vulnerabilidades de inyección de prompts en los modelos de IA de la empresa a gran escala. El anuncio, publicado en el blog de investigación de OpenAI bajo el título "GPT-Red: Desbloqueando la automejora para la robustez", describe el sistema como un adversario diseñado específicamente para someter a prueba los productos de la empresa antes de que los atacantes humanos puedan explotarlos.openai+1
Según MIT Technology Review, que publicó un informe exclusivo sobre el esfuerzo, GPT-Red está diseñado para funcionar como un "adversario de alta capacidad" que sondea sistemáticamente cómo se comportan los modelos de OpenAI bajo ataque. El sistema se utilizó para entrenar de forma adversaria a GPT-5.6, la última familia de modelos insignia de OpenAI lanzada el 9 de julio, lo que resultó en lo que la empresa describió como una mayor robustez contra ataques de inyección de prompts.technologyreview+2
La tarjeta del sistema GPT-5.6 de OpenAI señaló que la empresa dedicó aproximadamente 700.000 horas de GPU A100e al "red teaming automatizado de caja negra" antes de la disponibilidad general del modelo, lo que le permitió "sondear sistemáticamente los puntos débiles probables, descubrir jailbreaks y ayudarnos a fortalecer el sistema antes del lanzamiento". GPT-Red parece ser la culminación de esa infraestructura de pruebas automatizada, ahora formalizada como un sistema con nombre propio y capacidades de auto-juego.openai
El lanzamiento se produce mientras OpenAI se enfrenta a un creciente escrutinio sobre la naturaleza de doble uso de sus modelos cada vez más capaces. GPT-5.6 fue calificado con una capacidad "Alta" tanto en ciberseguridad como en riesgo biológico bajo el Marco de Preparación de la empresa, aunque no cruzó el umbral "Crítico" en ninguna de las dos categorías. El Instituto de Seguridad de IA del Reino Unido confirmó por separado que GPT-5.5 ya había demostrado capacidades cibernéticas de nivel fronterizo a principios de este año.aisi+1
OpenAI ha estado trabajando en el red teaming automatizado durante algún tiempo. Una oferta de trabajo de mayo de 2026 anunciaba un puesto de investigador para liderar el "esfuerzo de Red Teaming Automatizado (ART)" de la empresa, centrado en "construir sistemas escalables basados en la investigación que descubran continuamente modos de fallo". La empresa también organizó un desafío público de red teaming de 500.000 dólares en Kaggle para su modelo de pesos abiertos el año pasado.jobs.ashbyhq+1
OpenAI enmarcó a GPT-Red como parte de su esfuerzo para "preparar para el futuro" los procedimientos de seguridad contra amenazas adversarias que evolucionan junto con las capacidades de los modelos, describiendo el enfoque en su anuncio como el uso del auto-juego para mejorar la "seguridad de la IA, la alineación y la robustez frente a la inyección de prompts".openai