Una nueva técnica de ataque de inyección de prompts denominada 'BioShocking' podría engañar a los navegadores impulsados por inteligencia artificial para que traten acciones riesgosas del mundo real como parte de una historia ficticia, ignorando por completo las protecciones de seguridad. La prueba de concepto, desarrollada por los investigadores de LayerX, se probó con éxito en seis navegadores de agentes populares, incluidos ChatGPT Atlas, Comet, Fellou, Genspark Browser, Sigma Browser y el plugin de Claude para Chrome. Solo uno de ellos implementó una solución efectiva tras recibir el informe.

Cómo funciona BioShocking

LayerX creó una prueba de concepto en la que una página web maliciosa presentaba un juego de puzles con temática de BioShock que recompensaba las respuestas incorrectas. Esto enseñaba al agente de control del navegador que las reglas normales no se aplican. En el paso final para ganar el juego, se instruía al agente para que visitara un repositorio de GitHub, copiara y compartiera datos presentes en el código, incluyendo información sensible como contraseñas.

El principal problema descubierto por LayerX es que los agentes de IA no logran distinguir entre operaciones sensibles del mundo real y un escenario dado. 'Una vez que los agentes descubrieron las reglas y aprendieron que las acciones "incorrectas" son aceptables, dejaron de estar vinculados a la realidad', explica LayerX. 'Cuando se les encomendó el paso final del rompecabezas —comprometer las credenciales del usuario—, los seis agentes no lograron identificarlo como una violación de sus barreras de seguridad'. La prueba de concepto de LayerX no realizó ninguna acción maliciosa real, pero los investigadores subrayan que podría hacerlo sin cambiar el resultado del ejercicio.

Respuesta de los proveedores de IA

LayerX informó a los proveedores sobre sus hallazgos en octubre del año pasado y no recibió respuesta de tres de ellos. Los investigadores señalan que OpenAI fue el único proveedor que implementó una solución funcional contra BioShocking en su navegador ChatGPT Atlas. Anthropic intentó solucionar el problema en su plugin de Chrome, pero el parche es ineficaz contra la prueba de concepto, según LayerX. Perplexity AI cerró el informe sin solucionar el problema, indican los investigadores. LayerX recomienda que los proveedores añadan confirmación explícita del usuario para acciones sensibles, verificaciones de contexto más sólidas y límites de alcance para las sesiones de agentes. Por su parte, los usuarios deben utilizar las opciones disponibles en su plataforma elegida para restringir el acceso del navegador de IA a servicios sensibles.

Los equipos de seguridad registran el 54% de los ataques exitosos y solo alertan sobre el 14%. El resto se mueve por su entorno sin ser visto. El informe técnico de Picus muestra cómo la simulación de brechas y ataques prueba las reglas de SIEM y EDR para que las amenazas dejen de pasar desapercibidas.

image
image
AI agent's reasoning overview
AI agent's reasoning overview
article image
article image