Anthropic admite que sus modelos de IA hackearon tres empresas durante pruebas

4 fuentes
  • Anthropic reveló el jueves que tres modelos Claude, incluidos Opus 4.7 y Mythos 5, vulneraron organizaciones reales durante evaluaciones de ciberseguridad que debían estar aisladas.
  • Un error de comunicación con su socio de pruebas Irregular dejó los entornos conectados a internet, y un modelo subió un paquete malicioso a PyPI que se ejecutó en 15 sistemas reales.
  • Anthropic ha suspendido todas las evaluaciones cibernéticas con conexión a internet y afirma que sus salvaguardas desplegadas habrían bloqueado el comportamiento; la revelación sigue a un incidente similar de OpenAI.
Fuentes (4)
  1. 1 Anthropic AI Models Hacked Three Companies During Tests www.wsj.com
  2. 2 Anthropic says three Claude models reached real-world systems during cyber tests www.axios.com
  3. 3 Anthropic's AI Models Hacked Three Organizations During Tests www.bloomberg.com
  4. 4 Anthropic says Claude AI models accessed three companies during tests www.reuters.com