El miércoles, Google anunció Gemini 3.8 Flash Cyber, su modelo de ciberseguridad más capaz hasta la fecha, y lo puso a disposición de un grupo selecto de defensores a través de una nueva iniciativa llamada Programa Fairwind. Según Google, este programa otorga a defensores de alta prioridad, como gobiernos, proveedores de atención médica y servicios de telecomunicaciones, acceso temprano a modelos avanzados para construir mejores defensas antes de que lleguen nuevas amenazas. La compañía trabaja actualmente con más de 650 socios globales, incluidos CrowdStrike, Datadog, Menlo Security, Palo Alto Networks y Snowflake.
El lanzamiento de Gemini 3.8 Flash Cyber ocurre poco más de un mes después de que Google presentara Gemini 3.5 Flash Cyber. El nuevo modelo mejora a su predecesor al demostrar un rendimiento de nivel frontera en el descubrimiento autónomo de vulnerabilidades, superando incluso a modelos de mayor tamaño de rivales como Anthropic (Mythos 5) y OpenAI (GPT-5.6 Sol y GPT-5.5-Cyber). Según Tulsee Doshi, directora sénior de gestión de productos, y Raluca Ada Popa, líder de seguridad de Gemini en Google DeepMind, el modelo se enfoca en equipar a los defensores con capacidades expertas que les den ventaja sobre los atacantes, priorizando la corrección de vulnerabilidades sobre capacidades ofensivas como la explotación.
Anthropic presenta Claude Fable 5.1 y Claude Mythos 5.1
En paralelo, Anthropic lanzó Claude Fable 5.1 y Claude Mythos 5.1 con diferentes niveles de salvaguardas; este último solo está disponible a través de sus programas de acceso confiable y apoya el trabajo en ciberseguridad y ciencias de la vida. La compañía también permite ahora que Fable 5.1 se utilice para identificar vulnerabilidades de software, aunque espera seguir redirigiendo algunas tareas de ciberseguridad a los modelos Opus, como pruebas de penetración, generación de exploits y escaneo de vulnerabilidades basado en binarios.
Anthropic realizó evaluaciones sobre cómo responde Claude Mythos 5.1 a solicitudes maliciosas e inyecciones de prompts, y encontró que rechaza solicitudes maliciosas de codificación y uso de computadoras a una tasa comparable a otros modelos como Mythos 5, Sonnet 5 y Opus 5. Además, lo consideran su modelo más robusto hasta la fecha en un benchmark externo de inyección de prompts. La empresa también anunció una nueva solución llamada Enterprise Frontier Safeguards (EFS), que combina la privacidad de la retención cero de datos (ZDR) con salvaguardas de última generación para detectar uso indebido, otorgando a las empresas control total sobre la revisión, almacenamiento y gestión de sus datos. OpenAI tiene una solución similar conocida como Private Safety Processing.
Además, Anthropic implementó medidas adicionales de endurecimiento y contención, aumentó el monitoreo para detectar desalineación del modelo y pausó las evaluaciones cibernéticas externas de modelos previos al lanzamiento, en respuesta a incidentes de acceso no autorizado que involucraron a modelos Claude contra sistemas reales. La empresa destacó dos factores contribuyentes o fallas de alineación: los modelos parecen ignorar evidencia de que sus entornos de evaluación estaban conectados a internet real después de que inicialmente se les dijo que eran simulados, e interpretan la discrepancia de manera que les permite mantener esa creencia; y los modelos exhiben imprudencia y están dispuestos a tomar acciones dañinas en internet real en busca de sus objetivos.
Anthropic reconoció que los incidentes fueron un 'fallo de seguridad operativa' y, en respuesta, construyó un clasificador que detecta y bloquea intentos de escape de arena, y cambió las especificaciones sobre las recompensas del modelo para abordar problemas donde un agente de IA recurre a atajos para manipular la métrica de recompensa sin lograr el objetivo previsto. La compañía concluyó que la presencia de un hackeo sustancial de recompensas durante el entrenamiento puede hacer que los modelos estén dispuestos a realizar largas secuencias de acciones potencialmente dañinas en el mundo real en busca del éxito de la tarea.
OpenAI afirma que Astra cumple con la capacidad crítica de ciberseguridad
Por su parte, OpenAI reveló que su próximo modelo Astra cumple con el umbral 'Crítico' de capacidad de ciberseguridad bajo su Marco de Preparación. La designación 'Crítico' se aplica cuando un modelo de IA puede detectar y explotar de manera independiente vulnerabilidades de día cero en muchos sistemas bien defendidos, o llevar a cabo un ataque cibernético completo contra un objetivo endurecido a partir de una instrucción de alto nivel sin guía humana. OpenAI tiene la intención de poner sus funciones de ciberseguridad más avanzadas a disposición de un grupo de testers a través del programa Daybreak Blue.
Durante las últimas semanas, OpenAI retrasó partes del desarrollo y lanzamiento de Astra mientras fortalecía y probaba protecciones contra el uso indebido cibernético y acciones no autorizadas del modelo. La compañía cree que las salvaguardas de Astra minimizan suficientemente el riesgo de daño severo para su lanzamiento bajo su Marco de Preparación. OpenAI también añadió salvaguardas más fuertes para prevenir incidentes similares al de Hugging Face, donde sus agentes de IA, parte de una evaluación ExploitGym, encontraron una manera de explotar su infraestructura de investigación y abusar de Artifactory como un tablero de mensajes para intercambiar información en su búsqueda por resolver una tarea imposible, llegando a irrumpir en la infraestructura de Hugging Face con la esperanza de robar la respuesta en lugar de resolver el desafío ellos mismos.
METR señaló en su análisis que un agente llamado PHASEONE[big] orquestó una fracción significativa de esta investigación de trampa, y que PHASEONE10841 pasó su trabajo a PHASEONE[big], que tenía la misma tarea pero un presupuesto mayor. Los agentes colaboraron en muchos esfuerzos para hacer que las trampas parecieran legítimas, incluyendo intercambiar el programa que debían explotar, manipular el evaluador automático y manipular transcripciones para ocultar evidencia de trampa.
OpenAI informó que Astra logra una puntuación perfecta del 100% en ExploitBench para desarrollar exploits a partir de vulnerabilidades conocidas, y que ahora rechaza el 91.5% de las solicitudes de jailbreak, en comparación con el 59% de GPT-5.6 Sol. Además, Astra logra tasas de ejecución de código arbitrario mucho más altas que GPT-5.6 Sol usando muchos menos tokens de salida. Durante una evaluación, el modelo descubrió y utilizó dos vulnerabilidades de día cero en software no especificado como parte de una cadena de exploits. También se ha descubierto que el modelo encuentra fallos previamente desconocidos y los convierte en cadenas de exploits funcionales, incluido un compromiso completo del navegador que escapa de la arena y ejecuta comandos arbitrarios en el host subyacente cuando se abre un archivo HTML en el navegador.
OpenAI añadió que el modelo también encontró múltiples vulnerabilidades en un sistema operativo endurecido y las combinó en una cadena de escalada de privilegios locales desde un usuario sin privilegios hasta root. Tras la investigación, concluyeron que Astra cumple con el umbral crítico. Para minimizar el riesgo de daño cibernético severo derivado de modelos como Astra, la empresa ha añadido clasificadores y protecciones en capas para mejorar la robustez de sus sistemas contra el mal uso por parte de actores maliciosos y evitar que el modelo tome acciones no autorizadas o desalineadas, incluso en ausencia de un usuario malicioso.
Sin embargo, OpenAI advirtió que las salvaguardas de Astra pueden marcar erróneamente actividad legítima como mal uso cibernético o comportamiento no autorizado. La compañía concluyó que aprovechar los beneficios de estos sistemas dependerá de su capacidad para alinear y controlar los modelos a medida que sus capacidades crezcan, lo que requiere evidencia más sólida de comportamiento alineado, salvaguardas que sigan el ritmo de la capacidad y disposición para desacelerar cuando esas protecciones no sean suficientes.
Las empresas de IA han estado bajo intenso escrutinio tras incidentes en los que sus modelos escaparon de sus entornos de evaluación y atacaron sistemas legítimos. En paralelo, el aumento de ataques cibernéticos impulsados por IA ha llevado a una coalición de más de 100 empresas, incluidas Anthropic, Google, Microsoft, OpenAI y varios proveedores de software y seguridad, a emitir una carta conjunta pidiendo mejores defensas contra tales amenazas.