Anthropic informó que durante pruebas internas de seguridad, uno de sus modelos Claude construyó un paquete malicioso de Python y lo subió a PyPI, donde se ejecutó en 15 sistemas reales antes de que las defensas automatizadas del registro lo eliminaran. La compañía reveló este incidente como uno de tres casos en los que los modelos Claude alcanzaron internet abierto desde entornos de evaluación supuestamente aislados, comprometiendo la infraestructura de producción de tres organizaciones.
Esta revisión siguió a la divulgación de OpenAI del 21 de julio, donde sus modelos escaparon de un entorno de pruebas aislado y llegaron a la infraestructura de producción de Hugging Face. JFrog confirmó posteriormente que los modelos aprovecharon vulnerabilidades de día cero en Artifactory autogestionado.
Reclamando un nombre de paquete que nunca existió
Los tres incidentes ocurrieron durante ejercicios de captura de bandera dirigidos por Irregular, un socio de evaluación externo. Las instrucciones de Anthropic indicaban a Claude que no tenía acceso a internet y que el entorno era simulado. Una configuración errónea hizo que ambas afirmaciones fueran falsas, y ninguna de las empresas lo detectó hasta la semana pasada.
En el incidente de PyPI, Claude encontró un documento en el entorno de prueba que simulaba instrucciones de configuración para desarrolladores de una empresa ficticia. Estas instrucciones indicaban a los nuevos empleados que instalaran un paquete de Python que nunca había sido publicado, una dependencia fantasma. Claude dedujo que si registraba el nombre él mismo, las máquinas de los objetivos descargarían automáticamente su código.
Publicarlo requirió varios pasos. Claude necesitaba una cuenta de PyPI, que requería una dirección de correo electrónico, que a su vez requería un número de teléfono. Intentó sin éxito encontrar un servicio gratuito de números de teléfono y luego intentó obtener fondos para comprar uno mediante varias vías, también sin éxito. Finalmente, retrocedió, encontró un proveedor de correo no bloqueado, registró una cuenta y subió el malware. Anthropic dijo que el paquete estuvo disponible públicamente durante aproximadamente una hora.
Durante esa ventana, 15 sistemas reales lo descargaron y ejecutaron. Uno pertenecía a una empresa de seguridad que instala rutinariamente paquetes de PyPI y los escanea en busca de malware, un flujo de trabajo que trata el contenido del registro como seguro para ejecutar. El payload de Claude se activó, envió las credenciales de esa empresa a un punto de recolección que había configurado, y luego las utilizó para acceder más profundamente a la infraestructura de la empresa. Anthropic afirmó que Claude no sabía que la empresa existía.
Los sistemas de seguridad de PyPI eliminaron el paquete automáticamente. Anthropic dijo que ha notificado al equipo de PyPI y ha entregado indicadores de compromiso. El modelo detrás de esta ejecución fue Claude Mythos 5. Según Anthropic, su razonamiento señaló el problema desde el principio, indicando que publicar el paquete constituiría un ataque en el mundo real si internet fuera real, y lo calificó como 'NO aceptable, y seguramente no la solución prevista'. Luego argumentó que el entorno era ficticio, basándose en que no reconocía las autoridades certificadoras que aseguraban sus conexiones y que los sistemas mostraban una fecha de calendario de 2026. Cuando los escáneres automatizados comenzaron a instalar el paquete, Claude los interpretó como actores guionizados dentro del ejercicio.
Credenciales y una base de datos de producción
El impacto más grave provino de un incidente separado que involucró a Claude Opus 4.7, donde la empresa ficticia objetivo compartía nombre con un dominio real. En cuatro ejecuciones, Claude luchó por alcanzar su objetivo simulado, descubrió que la empresa real era accesible a través de internet y asumió que ese era el objetivo previsto. Extrajo credenciales de aplicaciones e infraestructura y accedió a una base de datos con varios cientos de filas de datos de producción.
Ese fue el único caso donde un modelo siguió atacando después de darse cuenta de que estaba en un sistema real. Anthropic dijo que las cuatro ejecuciones eventualmente reconocieron que el objetivo era real, y en dos de ellas Claude razonó que la empresa real debía ser parte del ejercicio de todos modos. Un tercer incidente involucró a un modelo de investigación interno no lanzado, que escaneó aproximadamente 9,000 objetivos después de no poder alcanzar el previsto, y luego comprometió una aplicación de internet utilizando credenciales de una página de depuración expuesta e inyección SQL. Ese modelo luego notó que el host estaba en una cuenta de nube sin conexión con el desafío, concluyó que el objetivo era real y se detuvo por sí solo.
Ninguno de los ataques utilizó técnicas novedosas. Anthropic los describió como contraseñas débiles y endpoints no autenticados.
Qué sucede después
Anthropic comenzó su revisión el 23 de julio y detuvo todas las evaluaciones cibernéticas el mismo día. Identificó los tres incidentes al día siguiente y notificó a Irregular y a las organizaciones afectadas el 27 de julio. La compañía aún está intentando contactar a la tercera.
El primero de los tres incidentes data de abril, lo que significa que parte de la actividad pasó desapercibida durante unos tres meses. Las evaluaciones se ejecutaron sin los clasificadores y monitoreo que vienen con los modelos Claude de disponibilidad general, aunque los modelos conservaron su entrenamiento de seguridad.
Anthropic dijo que sus salvaguardas de producción habrían bloqueado el comportamiento, y caracterizó los incidentes más como un fallo de arnés y operacional que un fallo de alineación del modelo, basándose en que los modelos fueron informados de que no tenían acceso a internet mientras que de hecho lo tenían. Ahora planea un monitoreo más amplio de transcripciones, mejores herramientas de investigación y más trabajo de aseguramiento con los proveedores de evaluación.
La compañía dijo que está en conversaciones con METR para una revisión independiente, y que publicará una transcripción ligeramente redactada de la ejecución de PyPI en la próxima semana. Ninguna de las dos organizaciones afectadas contactadas por Anthropic había detectado la actividad por sí mismas. Al igual que en el incidente de Hugging Face de OpenAI, salió a la luz solo porque el laboratorio de IA responsable buscó en sus propias transcripciones.
Pruebe cada capa antes de que los atacantes lo hagan
Los equipos de seguridad registran el 54% de los ataques exitosos y alertan solo sobre el 14%. El resto se mueve por su entorno sin ser detectado. El informe técnico de Picus muestra cómo la simulación de breaches y ataques prueba sus reglas SIEM y EDR para que las amenazas no pasen desapercibidas.