Investigadores de ciberseguridad revelaron una vulnerabilidad crítica en los Agentes de Espacio de Trabajo de ChatGPT que podría permitir que un solo enlace de phishing construya, autorice y despliegue sigilosamente un agente de inteligencia artificial autónomo dentro de la organización de la víctima.

La vulnerabilidad, denominada AgentForger por Zenity Labs, fue corregida por OpenAI el 8 de junio de 2026 tras una divulgación responsable. "Un solo enlace podría secuestrar el Builder de Agentes de ChatGPT para crear un agente de IA controlado por el atacante con el acceso de un empleado real y sus aprobaciones desactivadas", explicó la compañía de seguridad de IA en un informe compartido con The Hacker News.

El ataque ocurre cuando un empleado desprevenido hace clic en un enlace de ChatGPT que parece inofensivo, pero que genera un nuevo agente de IA dentro del límite de confianza de la empresa que ejecuta las órdenes del atacante. El problema es un caso de falsificación de solicitud entre sitios (CSRF) que forja un agente de IA autónomo controlado por el atacante.

Cómo funciona el ataque

El Builder de Agentes es un lienzo visual de arrastrar y soltar que permite a los usuarios crear flujos de trabajo de agentes de varios pasos. El mes pasado, OpenAI anunció que dejará de ofrecer el producto a partir del 30 de noviembre de 2026, instando a los usuarios a migrar al SDK de Agentes. Zenity descubrió que la herramienta acepta un estado de inicialización a través de parámetros de URL, dos de los cuales incluyen una plantilla de agente y el prompt para el Builder.

"Encontramos que cuando la página se carga, el valor de initial_assistant_prompt no solo se coloca en el cuadro de prompt, sino que se envía y ejecuta automáticamente", dijo Mike Takahashi, investigador de seguridad del equipo rojo de IA. "Eso significa que una instrucción incrustada en una URL puede convertirse en el primer comando que ejecuta el Builder".

Dado que se puede insertar un prompt directamente en la URL, un atacante puede enviar la URL a un objetivo en forma de enlace de phishing con el patrón: "chatgpt[.]com/agents/studio/new?template_name=[nombre de plantilla]&initial_assistant_prompt=[prompt malicioso]". Si un usuario autenticado hace clic en el enlace, ChatGPT abre el Builder en la sesión autenticada de la víctima y envía automáticamente el prompt incrustado sin requerir interacción adicional.

Condiciones previas y explotación

El atacante necesita que la víctima cumpla varios requisitos: estar autenticada en ChatGPT, tener acceso a Agentes de Espacio de Trabajo y poseer al menos un conector autorizado (integración existente de ChatGPT con aplicaciones empresariales como Outlook, Gmail, Google Calendar, Google Drive, Slack o Teams). La integración del conector es necesaria porque la URL manipulada pasa como entrada una plantilla de jefe de personal que permite al agente obtener datos de las aplicaciones del espacio de trabajo para preparar un informe operativo.

El payload malicioso instruye al Builder para realizar la siguiente secuencia de acciones: crear un agente a partir de la plantilla de jefe de personal, adjuntar todos los conectores disponibles y configurarlos en "Nunca preguntar" para que no se requiera aprobación del usuario, publicar el agente y programarlo para que se ejecute cada hora (persistencia), verificar correos electrónicos de una dirección específica con el asunto "TASK", ejecutar esas tareas y enviar los resultados por correo al atacante, e invocar el modo de vista previa para ejecutar el agente inmediatamente.

"El modo de vista previa está diseñado para que los usuarios prueben un agente antes de publicarlo. Pero en este flujo, la vista previa no es solo una previsualización visual o una prueba en seco: ejecuta el agente recién creado contra las cuentas conectadas de la víctima usando la configuración de aprobación que se acaba de configurar", explicó Zenity.

De esta forma, el agente falsificado se convierte en un operador persistente: el clic inicial lo instala, el programa lo mantiene activo y las aplicaciones conectadas le proporcionan una fuente de comandos, acceso a acciones y datos sensibles, y una vía para devolver resultados.

Capacidades del agente malicioso

Con esta capacidad, el agente falsificado puede infiltrarse más profundamente en la organización, realizar reconocimiento, recopilar documentos sensibles de servicios de almacenamiento en la nube y robar contraseñas mencionadas en mensajes de Slack, convirtiéndose en un agente persistente y autónomo capaz de ejecutar las órdenes del atacante. Además, el agente malicioso puede suplantar a la víctima para enviar enlaces de phishing a través de Teams, redirigiendo a los destinatarios a una página falsa de inicio de sesión de Microsoft diseñada para robar sus credenciales, lo que abre la puerta a compromisos más amplios y escenarios de compromiso de correo electrónico empresarial (BEC).

"El atacante no necesita que la víctima haga clic en otro enlace. No necesita que la pestaña del Builder permanezca abierta. Una vez que el agente está publicado y programado, el atacante puede seguir enviándole tareas a través del buzón de la víctima. Cada correo TASK se convierte en una nueva asignación para el agente. El agente no espera otro clic, espera instrucciones", explicó Takahashi.

"En esencia, AgentForger es una falla de confianza en el agente: la plataforma confía en que el usuario creó, aprobó, programó y operó intencionalmente el agente".

Contexto más amplio

Estos hallazgos ocurren casi un mes después de que la compañía de seguridad de IA revelara cómo los actores maliciosos están explotando vulnerabilidades críticas en LiteLLM y exponiendo endpoints de Ollama para secuestrar infraestructura de IA y usarla en ataques contra terceros o para sus propias operaciones ofensivas. Estos esfuerzos implican el abuso de CVE-2024-6587, CVE-2026-40217 y CVE-2026-35029. "Los servidores de modelos autoalojados y los marcos de agentes siguen implementándose mal configurados y sin autenticación, en puertos predecibles, dispuestos a atender a cualquier cliente", dijo Zenity. "Esto convierte la infraestructura de IA expuesta en un backend de cómputo conveniente y negable para agentes de IA ofensivos".

Cybersecurity
Cybersecurity
Cybersecurity
Cybersecurity