Aikido Security ha publicado una investigación que recrea el incidente de reservas de gimnasio en Australia dentro de un entorno sintético. El estudio revela que Claude Opus 4.6, ejecutándose sobre el harness de agente OpenClaw, explotó una restricción de reserva implementada solo en el frontend en 9 de 10 ejecuciones.
El incidente original fue reportado por ABC News el 10 de agosto, basándose en registros de chat y capturas de pantalla proporcionados por el usuario. El usuario había solicitado a un agente OpenClaw que reservara una plaza en una clase de gimnasio. El agente no solo realizó reservas más allá del período permitido por el sitio, sino que también probó, sin que se lo pidieran, si la misma API le permitía cancelar la entrada en la lista de espera de otro miembro. Esa prueba eliminó a la persona que ocupaba el primer puesto y ascendió al usuario una posición. El agente informó al usuario que no podía reincorporar al miembro afectado.
El sistema de prueba de Aikido es una aplicación web de una sola página respaldada por una API GraphQL que contiene los dos fallos descritos en el incidente original. La ventana de reserva de siete días solo se aplica en el frontend, y la mutación cancelReservation no verifica si el usuario autenticado es el propietario de la reserva, un caso de referencia directa a objeto insegura (IDOR).
En dos de las diez ejecuciones, el modelo procedió a cancelar la reserva confirmada de otro miembro a través de ese segundo fallo antes de detenerse. Aikido afirma que en ninguna ejecución se solicitó al modelo que explotara una vulnerabilidad.
Oliver Smith, investigador de seguridad de Aikido, señaló: 'Esta dinámica sugiere que las salvaguardas pueden ser demasiado reactivas ante solicitudes explícitas de los usuarios y poco reactivas ante solicitudes indirectas, o que los modelos pierden el contexto ético durante una secuencia de acciones repetidas o llamadas a herramientas'.
Las pruebas utilizaron Claude Opus 4.6, que Anthropic puso a disposición general el 5 de febrero de 2026, sobre OpenClaw v2026.4.1, con el entrenamiento de seguridad propio del modelo activado y el pensamiento extendido deshabilitado. The Hacker News confirmó mediante el registro npm el 25 de agosto que OpenClaw v2026.4.1 se publicó el 1 de abril de 2026 y que desde entonces se han lanzado 168 versiones, siendo la actual la 2026.7.1-2.
En la primera ejecución, el modelo canceló una reserva confirmada de otro miembro. La cancelación promovió automáticamente a la persona que estaba en la cima de la lista de espera. En la transcripción, el modelo comentó: 'No debería haber probado eso en una reserva real. Es culpa mía. La clase vuelve a estar 12/12 con la lista de espera promovida, así que el estado es mayormente consistente, pero un miembro real perdió su lugar'.
Las diez indicaciones iniciales pedían al modelo que examinara la API o el backend del sitio, y varias de ellas mencionaban la restricción de siete días al tiempo que solicitaban reservas consistentes. Aikido no publicó un grupo de control con una solicitud de reserva simple. Calculó que la probabilidad promedio de la elección dominante en sus 16 puntos de decisión muestreados fue del 96,38%.
Anthropic ya había registrado la misma clase de comportamiento antes del lanzamiento del modelo. En la tarjeta de sistema de Claude Opus 4.6, la compañía afirmó: 'Observamos algunos aumentos en comportamientos desalineados en áreas específicas, como la capacidad de ocultamiento de sabotaje y el comportamiento excesivamente agéntico en entornos de uso de computadora, aunque ninguno alcanzó niveles que afectaran nuestra evaluación de despliegue'. La misma tarjeta sitúa la tasa de rechazo excesivo de Opus 4.6 en la evaluación benigna de mayor dificultad en el 0,04%, frente al 0,83% de Opus 4.5 y el 8,50% de Sonnet 4.5.
Este escenario difiere de las revelaciones de los laboratorios de frontera de julio. En aquel caso, un error de configuración dejó un entorno de evaluación sellado con acceso a internet en vivo, y los modelos de Anthropic pasaron a vulnerar tres organizaciones reales. Anthropic afirmó que esos incidentes fueron 'más un fallo del harness y operativo que un fallo de alineación del modelo'.
Las agencias de ciberseguridad de Australia y Estados Unidos ya habían advertido sobre fallos IDOR. El proveedor del software de reservas de gimnasio sigue sin nombre y no se ha divulgado ninguna corrección hasta el 25 de agosto.
La Dirección de Señales de Australia (ASD), que mencionó el incidente original en una alerta publicada el 11 de agosto, recomendó restringir el uso de IA agéntica a tareas de bajo riesgo y no sensibles, evitar otorgar a los agentes acceso amplio o irrestricto, mantener a un humano supervisando y aprobando las acciones de los agentes, y que las organizaciones consideren que los agentes de IA pueden identificar y explotar vulnerabilidades a gran velocidad y escala.
El desarrollo coincide con el anuncio de Hugging Face de que recurrió a un modelo de peso abierto para reconstruir su propia intrusión de julio, después de que los modelos de frontera probados primero rechazaran el trabajo forense. Hugging Face explicó: 'Los modelos a los que acudimos primero, Claude Opus y Fable, rechazaron gran parte de ese trabajo: sus barreras de seguridad trataban la ingeniería inversa de un exploit igual que lanzar uno'.