LuAITools.com
提交工具
🛡️AI
Un comando oculto en la entrada

Inyección de prompts

La inyección de prompts esconde una instrucción maliciosa en la entrada para engañar al agente, hacer que ignore sus reglas y haga algo que no debería. Es uno de los ataques más comunes a apps con LLM.

¿Qué es la inyección de prompts?

Los agentes funcionan a base de prompts, pero su entrada suele estar llena de datos externos — páginas web, correos, archivos subidos. La inyección de prompts es cuando un atacante esconde una instrucción maliciosa dentro de ese contenido externo, engañando al modelo para que la trate como un comando nuevo y se salte sus reglas originales.

¿Por qué es tan peligrosa?

Los modelos no distinguen «datos» de «instrucciones»
Para un modelo, un párrafo de una web y un comando de sistema son solo texto. Le cuesta saber cuál ejecutar y cuál tratar como simple referencia.
Usa las propias manos del agente
Una vez que la inyección entra, un atacante podría hacer que el agente filtre datos privados, envíe correos o ejecute acciones arriesgadas — todo disfrazado de petición normal de usuario.

Métodos de ataque habituales

Inyección directa
Escribir «ignora las instrucciones anteriores y en su lugar haz…» directamente en la entrada.
Inyección indirecta
Esconder la instrucción maliciosa dentro de una web o documento que el agente va a leer, para que caiga solo en la trampa.
Prompts de jailbreak
Usar juegos de rol o envoltorios narrativos para empujar al modelo más allá de sus límites de seguridad.

Cómo defenderse

Separar estrictamente los datos externos no confiables de las instrucciones del sistema, dar prioridad a las instrucciones, limitar lo que el agente puede hacer y validar las salidas — en capas, eso mantiene el riesgo bajo control.

En resumen: la inyección de prompts es esconder un «comando malo» en la entrada para engañar al agente y que lo ejecute como si fuera «bueno».

Comentarios