¿Qué es la inyección de prompts?
Los agentes funcionan a base de prompts, pero su entrada suele estar llena de datos externos — páginas web, correos, archivos subidos. La inyección de prompts es cuando un atacante esconde una instrucción maliciosa dentro de ese contenido externo, engañando al modelo para que la trate como un comando nuevo y se salte sus reglas originales.¿Por qué es tan peligrosa?
Los modelos no distinguen «datos» de «instrucciones»Para un modelo, un párrafo de una web y un comando de sistema son solo texto. Le cuesta saber cuál ejecutar y cuál tratar como simple referencia.
Usa las propias manos del agente
Una vez que la inyección entra, un atacante podría hacer que el agente filtre datos privados, envíe correos o ejecute acciones arriesgadas — todo disfrazado de petición normal de usuario.
Métodos de ataque habituales
Inyección directaEscribir «ignora las instrucciones anteriores y en su lugar haz…» directamente en la entrada.
Inyección indirecta
Esconder la instrucción maliciosa dentro de una web o documento que el agente va a leer, para que caiga solo en la trampa.
Prompts de jailbreak
Usar juegos de rol o envoltorios narrativos para empujar al modelo más allá de sus límites de seguridad.
Cómo defenderse
Separar estrictamente los datos externos no confiables de las instrucciones del sistema, dar prioridad a las instrucciones, limitar lo que el agente puede hacer y validar las salidas — en capas, eso mantiene el riesgo bajo control.En resumen: la inyección de prompts es esconder un «comando malo» en la entrada para engañar al agente y que lo ejecute como si fuera «bueno».
Comentarios