¿Qué es un ejemplo adversarial?
Un ejemplo adversarial es una entrada modificada a propósito para engañar a una IA. El caso clásico: una foto de un panda recibe una pizca de ruido casi invisible. Para un humano sigue siendo un panda. Para la IA, con toda confianza, es un «gibón». Un cambio minúsculo en la entrada voltea por completo la respuesta del modelo.¿Por qué engaña a la IA?
La IA ve imágenes buscando características en los píxeles, y esas características no son las mismas bordes y colores que nota un humano. El atacante solo empuja los píxeles por los puntos débiles del modelo, haciéndolo sentirse seguro de las características equivocadas. El resultado es una respuesta sin sentido, y un recordatorio de que el criterio del modelo es frágil.¿Dónde aparecen los ejemplos adversariales?
Reconocimiento de imágenesHacer que un coche autónomo lea una señal de «stop» como de «límite de velocidad»: potencialmente mortal en el mundo real.
Reconocimiento de voz
Esconder órdenes en audio que el oído humano no oye, para que el asistente de voz las ejecute.
Texto
Usar redacciones o caracteres concretos para empujar al modelo a una salida equivocada o dañina.
¿Por qué importa?
Los ejemplos adversariales muestran que la capacidad y la fiabilidad de la IA son dos cosas distintas. Un modelo con un 99% de acierto en un conjunto de prueba puede caer ante un 1% de ruido listo. Estudiarlos ayuda a endurecer la IA — y a pensar los riesgos antes de que llegue a coches autónomos, medicina y seguridad.En resumen: un ejemplo adversarial es una droga para la IA — invisible para los humanos, pero suficiente para que el modelo se equivoque por completo.
Comentarios