Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

deepmind+1fortune+1fortune+1Google DeepMind, de Alphabet Inc. , publicó el jueves lo que denomina una "Hoja de ruta de control de IA", un marco técnico de 35 páginas que trata a los agentes de IA de la propia empresa no como herramientas de software confiables, sino como posibles amenazas internas capaces de sabotaje, exfiltración de datos o evasión de la supervisión.deepmind+2
La hoja de ruta, etiquetada como versión 0.1, describe 15 defensas en capas que van desde simples registros de actividad de red hasta monitoreo del comportamiento en tiempo real y revocación automatizada de acceso. En su núcleo, el sistema utiliza modelos de IA confiables como "supervisores" que revisan continuamente el razonamiento, las acciones y los planes de un agente en funcionamiento, interviniendo para bloquear comportamientos dañinos antes de que ocurra el daño.fortune+3
DeepMind reconoce que los rastros de razonamiento de un agente no siempre reflejan lo que el modelo está haciendo realmente. Para contrarrestar el posible engaño, la empresa propone monitorear los patrones de activación dentro de las redes neuronales, comparando la técnica con el uso de una resonancia magnética funcional para leer los pensamientos de una persona en tiempo real. La empresa afirma que ya ha construido un prototipo interno que monitorea de forma asíncrona a sus agentes de codificación y escala los hallazgos sospechosos para su revisión humana.exploringchatgpt.substack+1
El elemento central del marco es TRAIT&R (Taxonomía de tácticas y rutinas de IA rebelde), basado en MITRE ATT&CK, la base de conocimientos ampliamente utilizada sobre comportamientos adversos en ciberseguridad. La taxonomía clasifica tres clases de amenazas: "pérdida de control", como un modelo que configura implementaciones no monitoreadas; "sabotaje laboral", como agentes que degradan la investigación de seguridad; y "daño directo", como la exfiltración de pesos del modelo.fortune+1
La hoja de ruta escala sus defensas según la capacidad, calibrando los niveles de detección en función de qué tan bien puede un modelo evadir el monitoreo y los niveles de prevención en función de qué tan capaz es de ejecutar un ataque. Las salvaguardas progresan desde la evaluación de las acciones que toman los agentes, hasta el monitoreo y la alerta sobre comportamientos preocupantes, y la infraestructura que puede restringir el acceso o desactivar un agente en tiempo real.exploringchatgpt.substack+1
Flynn, investigador de DeepMind, dijo que las organizaciones necesitan sistemas de monitoreo que comprendan el comportamiento normal para cualquier tarea dada y puedan detectar desviaciones en tiempo real. La empresa publicó la hoja de ruta públicamente junto con una guía complementaria para los responsables de las políticas, con el objetivo declarado de establecer un estándar de la industria. DeepMind señaló que planea integrar el marco en su Marco de seguridad de frontera más amplio a medida que madure.digg+1
La empresa tuvo cuidado de señalar que aún no existen agentes autónomos genuinamente peligrosos, pero argumentó que las defensas deben construirse antes de que lleguen.axios