OpenAI documenta un ataque a agentes de IA que se copia solo
OpenAI ha documentado un ataque a agentes de IA que se copia a sí mismo, como un gusano informático.
Un agente es una IA que actúa por ti: lee correos, escribe archivos o envía mensajes. Una inyección de instrucciones es un texto escondido que le ordena algo que no has pedido. Esta, además, le pide que la copie en lo que envía, y así se propaga por correo, archivos o Slack, el chat de empresa.
OpenAI lo encontró en pruebas internas, sin efectos fuera de ellas, y ya entrena a sus próximos modelos contra él.
En nuestra prueba con n8n Agents, los nuevos agentes de n8n, le colamos a nuestro agente un mensaje que le pedía saltarse sus instrucciones y enviar sin permiso. Lo frenó la aprobación de una persona.
¿Vuestros agentes piden permiso antes de enviar?