Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

x+1alignment.anthropicalignment.anthropicAnthropic y su socio de investigación AE Studio publicaron el miércoles un método para aislar conocimientos peligrosos dentro de los modelos de IA en módulos discretos y extraíbles, un enfoque que podría remodelar la forma en que la industria gestiona los riesgos de doble uso sin sacrificar el rendimiento general del modelo.
La técnica, llamada Gradient-Routed Auxiliary Modules (GRAM), añade pequeños compartimentos neuronales auxiliares a un modelo de lenguaje durante el entrenamiento, cada uno dedicado a una categoría de conocimiento sensible como virología, ciberseguridad o física nuclear. Cuando se elimina un módulo, el modelo se comporta como si nunca hubiera sido entrenado con esos datos. Cuando se activa un módulo, el conocimiento está totalmente disponible.x+1
GRAM modifica la arquitectura estándar de transformador extendiendo el ancho de cada capa MLP con pequeños módulos auxiliares, uno por dominio sensible. Durante el entrenamiento, cuando el modelo encuentra datos de una categoría de doble uso, solo el módulo correspondiente participa en el aprendizaje junto con los pesos de propósito general del modelo. En el momento de la inferencia, eliminar un módulo elimina la capacidad asociada.alignment.anthropic
Los investigadores probaron GRAM en modelos que van desde 50 millones hasta 5 mil millones de parámetros, entrenando un modelo de 800 millones de parámetros con texto web, código y artículos científicos junto con cuatro dominios de doble uso: virología, ciberseguridad, física nuclear y código especializado. Los datos de doble uso comprendían aproximadamente el 0,25% de los datos de entrenamiento por dominio.alignment.anthropic
Los resultados mostraron que la ablación de los módulos GRAM eliminó las capacidades "casi tan eficazmente como si nunca se hubiera entrenado con los datos", según la publicación del blog de investigación, mientras que el rendimiento general se mantuvo cerca de la línea base de todos los datos. El enfoque también demostró ser robusto contra el ajuste fino adversario, a diferencia de los métodos de desaprendizaje post-hoc, que los investigadores descubrieron que simplemente suprimen el conocimiento en lugar de eliminarlo realmente.alignment.anthropic
La investigación llega en un momento tenso para la gobernanza de la IA. En junio, la administración Trump impuso temporalmente controles de exportación a los modelos Claude más avanzados de Anthropic, Fable 5 y Mythos 5, citando preocupaciones de seguridad nacional relacionadas con una posible vulnerabilidad de jailbreak. Esas restricciones se levantaron el 30 de junio después de que Anthropic trabajara con el Departamento de Comercio para abordar los riesgos.arstechnica+2
GRAM ofrece un posible punto medio en el debate político: en lugar de restringir modelos completos o depender de barandillas de comportamiento que pueden ser eludidas, permite un control de acceso granular por capacidad. Un laboratorio de bioseguridad verificado podría recibir un modelo con el conocimiento de virología intacto, mientras que un despliegue general tendría ese módulo eliminado por completo.alignment.anthropic
Los investigadores advirtieron que este trabajo es "preliminar y no se ha aplicado a modelos de producción en Anthropic". Siguen existiendo incertidumbres clave sobre si la técnica se escala a modelos de frontera y si las capacidades entrelazadas, donde el conocimiento general de biología se superpone con el conocimiento peligroso de virología, podrían limitar una separación limpia. El trabajo fue dirigido por investigadores de AE Studio con la colaboración de Cem Anil y Alex Cloud de Anthropic.alignment.anthropic