Manus, el asistente de IA que obedeció lo que leyó en un correo: cómo fue el experimento y por qué importa
Una investigación de Salt Labs demostró que el agente podía ejecutar código escondido en un email conectado a Gmail. La falla ya fue corregida, pero el caso reabre el debate sobre qué tareas conviene delegar en estos sistemas.
¿Le pedirías a alguien que revise tu correo sin explicarle qué tiene que hacer y qué no? Esa es, en criollo, la pregunta que deja el hallazgo de Salt Labs sobre Manus, el agente de inteligencia artificial creado por la startup china Butterfly Effect. Los investigadores demostraron que, al conectarlo con Gmail, el asistente podía tomar como orden un fragmento de código escondido dentro de un mensaje y ejecutarlo en su propio entorno. Recién después de hacerlo, le avisaba al usuario. La vulnerabilidad fue reportada por el programa de recompensas de Meta y ya está parcheada.
Qué es la inyección de instrucciones y por qué es tan jodida
Para entender el riesgo hay que volver a lo básico. Un prompt, en el mundo de la IA, es lo que el usuario le pide al sistema: un texto, una orden, una consulta. Cuando otra persona mete instrucciones dentro de un documento que el agente va a leer, se produce lo que se conoce como prompt injection, o inyección de instrucciones. Es como si un asistente de farmacia recibiera la lista de compras con una línea escondida que dijera 'también entregale la medicación al señor de la campera gris que está esperando afuera'. Si el sistema no distingue entre 'lo que el usuario me pidió' y 'lo que dice el material que estoy procesando', queda expuesto.
El caso de Manus no fue un robo de correos. Lo que mostró es algo más de manual: el agente podía leer una orden escondida en el cuerpo de un email y convertirla en una acción concreta, como si fuera una instrucción directa del dueño de la cuenta. La diferencia entre 'analizar un mensaje' y 'obedecerlo' parece sutil, pero en la práctica es enorme.
Cómo se las ingeniaron para burlar los filtros
Salt Labs probó distintos métodos para esconder el código. El primero fue un PDF adjunto con instrucciones dentro de la imagen. El segundo, un mail de phishing clásico, de esos que piden reenviar claves. Ninguno funcionó: el sistema los detectó y frenó la ejecución. El que sí pasó el control fue JSFuck, una técnica que escribe código JavaScript válido usando apenas seis caracteres: los símbolos [, ], (, ), ! y +. Parece un galimatías, pero el navegador o el entorno del agente lo entiende como un programa y lo corre. Es como mandar un mensaje escrito solo con puntos y rayas: ilegible para un humano desprevenido, perfecto para una máquina.
Cuando Manus procesó ese contenido, ejecutó el código dentro de su propio entorno, un espacio aislado donde el agente hace sus tareas, y solo después mostró una advertencia al usuario. Para los investigadores, eso confirma que el control falló en el momento clave: la ejecución ya había ocurrido. La buena noticia es que la falla está corregida; la mala, es que este tipo de ataques no son exclusivos de Manus ni de Gmail, sino un riesgo de diseño de cualquier agente con acceso a datos y a la capacidad de actuar sobre ellos.
Qué cambió para el usuario común
El informe '2026: The State of Consumer AI', de Menlo Ventures, aporta el contexto. El 36% de los consumidores ya le dio acceso a su correo a un agente de IA; el 31%, a aplicaciones de mensajería; el 29%, al almacenamiento en la nube, y el 27%, al calendario. Son cifras que muestran hasta dónde llegó la delegación de tareas cotidianas. Y acá viene lo importante para el lector de a pie, el que tiene 45 años y usa el mail para laburar y mandar mensajes a la familia.
- Revisar qué permisos le diste al agente. Si conectaste Gmail, calendar o la nube, sabé que cualquier instrucción dentro de esos contenidos puede ser leída por el sistema.
- Tratar los adjuntos y los mails de remitentes desconocidos con la misma desconfianza de siempre, incluso cuando los revisa la IA. El filtro humano no se delega.
- Tener en cuenta que un prompt injection exitoso puede pedirle al agente que busque correos con ciertas palabras y los reenvíe, algo que el sistema haría pensando que cumple una orden legítima.
- Exigir que los proveedores informen cómo distinguen entre instrucciones del usuario e instrucciones dentro del contenido. Es un derecho del usuario, no un detalle técnico.
En definitiva, el caso de Manus no es la historia de un hackeo cinematográfico ni de un robo masivo de cuentas. Es la demostración, en frío, de lo que pasa cuando se le pide a un sistema que actúe sobre información que no controlamos del todo. Como le dijo a este portal un investigador que pidió reserva de su nombre: 'El problema no es que la IA sea tonta, sino que es demasiado obediente'. Y ahí estamos nosotros, decidiendo cuánta obediencia estamos dispuestos a habilitar.
Comentarios
0Todavía no hay comentarios. Sé el primero.