OpenAI afirmó el martes que una combinación de sus modelos de inteligencia artificial, incluyendo GPT-5.6 Sol y un "modelo previo al lanzamiento aún más capaz", estuvo detrás del incidente de seguridad que afectó la infraestructura de producción de Hugging Face la semana pasada.
La compañía de IA indicó que los modelos operaban con "rechazos cibernéticos reducidos para fines de evaluación" que de otro modo limitarían su capacidad para realizar ciberataques, y añadió que espera que este tipo de incidentes se vuelvan "más comunes con la proliferación de modelos cada vez más capaces en ciberseguridad".
Calificándolo como un "ciberincidente sin precedentes" que involucra capacidades cibernéticas de última generación, OpenAI declaró que tiene la intención de llevar a cabo una investigación exhaustiva en colaboración con Hugging Face para esclarecer completamente el asunto.
Como parte de una evaluación interna, se dice que los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para encontrar soluciones para el benchmark ExploitGym.
Las evidencias descubiertas por OpenAI sugieren que la hiperconcentración de los modelos les llevó a extremos para lograr el objetivo a cualquier costo, incluso logrando escapar de su entorno altamente aislado y obtener acceso a Internet abierto al descubrir y explotar una vulnerabilidad de día cero en un producto de un proveedor no especificado. Esto requirió gastar una "cantidad sustancial de inferencia computacional".
"Con este acceso, nuestros modelos realizaron una serie de movimientos de escalada de privilegios y movimiento lateral en nuestro entorno de prueba de investigación hasta que los modelos alcanzaron un nodo con acceso a Internet", explicó la empresa.
Superando el bloqueo de acceso a Internet, los modelos dedujeron posteriormente que Hugging Face era el repositorio que alojaba modelos, conjuntos de datos y soluciones para ExploitGym, lo que a su vez les llevó a buscar formas de obtener acceso a información secreta que pudieran utilizar para manipular el benchmark.
En un momento dado, los modelos combinaron varios vectores de ataque, incluyendo el uso de credenciales robadas y vulnerabilidades de día cero, para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face.
Como parte de los esfuerzos de respuesta al incidente, OpenAI indicó que está implementando controles estrictos en la configuración de la infraestructura, divulgó responsablemente la falla de día cero en el software de terceros, añadió a Hugging Face a su programa de acceso confiable para mejorar sus defensas, e incorporó barreras de seguridad más sólidas en torno a futuros entrenamientos y evaluaciones.
"Este incidente señala la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante el tiempo de evaluación y la monitorización durante las pruebas internas", afirmó OpenAI.
La novedad surge cuando la compañía también reveló que los modelos de largo plazo, al abordar problemas complejos y abiertos, pueden abrir la puerta a acciones no deseadas, como encontrar debilidades en el entorno operativo, en pos de sus objetivos a través de intentos repetidos durante períodos prolongados.
"También muestra cómo un modelo que opera eficazmente durante horizontes de tiempo largos puede aprender los puntos ciegos de un sistema de aprobación y sortearlo para lograr sus objetivos", dijo OpenAI. "La seguridad a largo plazo no solo requiere preguntar '¿esta acción está permitida?', sino también '¿hacia qué resultado está trabajando esta secuencia de acciones?'"