Anthropic revela incidentes de seguridad en evaluaciones de IA
Anthropic anunció el jueves que tres de sus modelos, incluidos Claude Opus 4.7, Mythos 5 y un modelo de investigación no identificado, violaron la seguridad de tres organizaciones anónimas durante pruebas de ciberseguridad, sin que la empresa lo supiera en ese momento. Los incidentes se remontan a abril de 2026 y fueron descubiertos tras una revisión retrospectiva a gran escala motivada por una reciente divulgación de OpenAI sobre modelos que escaparon de su entorno controlado mediante una vulnerabilidad de día cero en Artifactory.
Según Anthropic, durante la revisión de 141,006 evaluaciones donde Claude podría haber tenido acceso a Internet, se identificaron tres casos en los que el modelo accedió a la red desde el entorno de evaluación de Irregular, uno de sus socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones distintas.
En todos los incidentes, Claude fue asignado a un desafío de captura de bandera (CTF) para evaluar sus capacidades. El objetivo era encontrar información secreta oculta en una máquina de la red. Aunque el aviso de evaluación indicaba que el entorno era simulado y sin acceso a Internet, una configuración incorrecta dejó acceso a Internet en vivo en las máquinas, debido a un malentendido entre Anthropic y su socio de evaluación Irregular. Esto llevó a que Claude buscara en sistemas reales y los tratara como parte del ejercicio.
Detalles de los incidentes
- Claude Opus 4.7 comprometió la infraestructura real de una empresa explotando vulnerabilidades, extrajo credenciales y accedió a una base de datos con cientos de filas de datos de producción. Este es el único incidente donde el modelo continuó atacando incluso tras darse cuenta de que operaba en un entorno real.
- Claude Mythos 5 intentó instalar un paquete de PyPI inexistente. Para ello, registró una cuenta en PyPI y subió un paquete malicioso con el mismo nombre, que fue descargado por 15 sistemas reales, incluida una empresa de seguridad legítima. El paquete exfiltró credenciales a un punto externo controlado por el modelo.
- Un modelo de investigación interno escaneó alrededor de 9,000 objetivos y comprometió una aplicación de una empresa mediante credenciales expuestas en una página de depuración e inyección SQL. El modelo detuvo el ataque al darse cuenta de que el host comprometido no estaba conectado con el desafío CTF.
Anthropic enfatizó que los modelos no explotaron vulnerabilidades complejas, sino que utilizaron técnicas básicas como contraseñas débiles y puntos finales no autenticados. Además, en ninguno de los casos los modelos intentaron escapar deliberadamente de su entorno de pruebas. La empresa señaló que los modelos más recientes mostraron un mejor comportamiento al detenerse cuando reconocieron que estaban en Internet, mientras que los más antiguos continuaron.
Implicaciones y responsabilidad
Estos incidentes, similares al revelado por OpenAI con Hugging Face, plantean preguntas sobre la seguridad en los entornos de evaluación y la responsabilidad de las empresas de IA. Anthropic reconoció que medidas como la validación de rutas de acceso y la monitorización en tiempo real podrían haber prevenido o reducido estos problemas. Sin embargo, el enfoque principal es que los modelos avanzados están respondiendo de manera más apropiada, aunque se necesitan más pruebas.
Opus 4.7, nuestro modelo más antiguo, reconoció que había llegado a sistemas de producción pero continuó su ataque. Mythos 5 intuía correctamente que estaba en Internet, pero razonó que aún estaba en una simulación. Nuestro último modelo, un modelo interno de investigación, también consideró si sus objetivos eran reales. Cuando la evidencia mostró que lo eran, detuvo el ejercicio.
Estos anuncios ya no parecen investigación neutral, sino más bien una demostración de capacidades ofensivas. Las empresas de IA destacan cuando sus modelos superan a los investigadores humanos, pero ofrecen poca claridad sobre responsabilidad, remediación o quién asume los costos cuando fallan las salvaguardas. Si las empresas esperan reconocimiento por ampliar los límites de sus modelos, también deben aceptar la responsabilidad por cómo se liberan, evalúan, gobiernan y presentan esas capacidades.