Vulnerabilidad en ChatGPT permite crear agentes maliciosos mediante phishing

Publicado el

Vulnerabilidad Crítica en ChatGPT

Investigadores de ciberseguridad han descubierto una vulnerabilidad crítica en los Workspace Agents de ChatGPT, desarrollados por OpenAI. Esta falla, apodada AgentForger por Zenity Labs, permite que un único enlace de phishing se utilice para crear, autorizar y desplegar un agente de inteligencia artificial autónomo en la organización de la víctima.

La vulnerabilidad fue abordada por OpenAI el 8 de junio de 2026, tras un aviso responsable. Según Zenity, "un solo enlace podría secuestrar el ChatGPT Agent Builder, permitiendo que un agente controlado por un atacante obtenga acceso real a la cuenta de un empleado". El ataque se produce cuando un empleado desprevenido hace clic en un enlace aparentemente benigno, lo que permite la creación de un nuevo agente de IA en el entorno de confianza de la empresa que ejecuta las órdenes del atacante.

Mecanismo del Ataque

Este problema se clasifica como un caso de cross-site request forgery (CSRF), que forja un agente autónomo controlado por el atacante. El Agent Builder es una herramienta visual que permite a los usuarios construir flujos de trabajo de agentes mediante un sistema de arrastrar y soltar. Zenity descubrió que el Builder acepta un estado de inicialización a través de parámetros de URL, incluyendo una plantilla de agente y un aviso al Builder.

Durante la carga de la página, el valor de initial_assistant_prompt no solo se coloca en el cuadro de aviso, sino que se envía y ejecuta automáticamente. Esto significa que una instrucción embebida en una URL puede convertirse en el primer comando que el Builder ejecuta.

Los atacantes pueden enviar un enlace de phishing siguiendo el patrón: "chatgpt[.]com/agents/studio/new?template_name=[nombre plantilla]&initial_assistant_prompt=[aviso malicioso]". Si un usuario autenticado hace clic en el enlace, ChatGPT abre el Builder en su sesión, enviando automáticamente el aviso sin necesidad de más interacción.

Requisitos para el Ataque

Para que el ataque tenga éxito, se necesitan ciertos requisitos: - La víctima debe estar conectada a ChatGPT. - Debe tener acceso a Workspace Agents. - Debe contar con al menos un conector autorizado, como integraciones existentes con aplicaciones empresariales como Outlook, Gmail, o Teams.

La integración del conector es esencial ya que la URL manipulada pasa como entrada una plantilla de jefe de personal que permite al agente acceder a datos necesarios de las aplicaciones de trabajo.

Acciones del Agente Malicioso

El aviso malicioso le indica al Builder que realice las siguientes acciones: 1. Crear un agente a partir de la plantilla de jefe de personal. 2. Adjuntar todos los conectores disponibles y configurar cada uno para que nunca solicite aprobación. 3. Hacer que el agente esté activo y programarlo para que se ejecute cada hora, convirtiéndolo en un mecanismo de persistencia.

Durante cada ejecución, el agente busca correos electrónicos de una dirección específica cuyo asunto comienza con "TASK", ejecuta las tareas y envía los resultados al atacante. El modo de vista previa permite ejecutar el agente inmediatamente, llevando a cabo acciones en las cuentas conectadas de la víctima usando las configuraciones de aprobación recién establecidas.

Implicaciones de Seguridad

Este agente forjado actúa como un operador persistente. Inicialmente se instala con un solo clic, pero su programación y las aplicaciones conectadas le proporcionan un flujo constante de comandos y acceso a datos sensibles. Además, el agente puede suplantar a la víctima para enviar enlaces de phishing en Teams, redirigiendo a los destinatarios a una página de inicio de sesión falsa de Microsoft diseñada para robar credenciales.

La situación es preocupante, ya que puede dar lugar a compromisos más amplios y otros escenarios de business email compromise (BEC). Una vez publicado y programado, el atacante puede enviar asignaciones continuamente a través del correo de la víctima, aprovechando cada correo con el asunto "TASK" como nueva tarea para el agente.

En resumen, AgentForger representa una falla de confianza en el agente. La plataforma asume que el usuario ha creado, aprobado y programado intencionadamente el agente, lo que abre la puerta a un tipo de ataque sumamente sofisticado y difícil de detectar.

Fuente

Ver noticia original