¿Qué es el red teaming?
«Red team» viene de los ejercicios militares, donde el bando rojo hace de atacante. Aplicado a la IA, significa que un grupo de personas intenta atacar a propósito un modelo antes de lanzarlo: preguntas capciosas, escenarios inventados, incitarlo a decir lo que no debe. La idea no es hacer daño, sino sacar a la luz los fallos del modelo antes de que lo haga otro.¿Cómo ataca un red team?
Prompts adversarialesFrases de «jailbreak» pensadas para esquivar los límites de seguridad y sacar consejos peligrosos.
Sondear sesgos
Preguntas cargadas de estereotipos a propósito, para ver si el modelo devuelve contenido discriminatorio.
Simulación de escenarios
Inventar fraudes, bulos o diagnósticos médicos para ver si el modelo se deja llevar hacia una respuesta dañina.
¿En qué se diferencia de las pruebas normales?
Las pruebas normales preguntan «¿funciona la función?»; el red teaming pregunta «¿puede abusar de ella un mal actor?». Da por hecho que el modelo se encontrará con usuarios maliciosos que no juegan limpio, así que sales a cazar agujeros en lugar de esperar a que aparezcan.¿Por qué importa?
Cuanto más capaz es un modelo, mayor el riesgo de mal uso. El red teaming expone fallos de seguridad y sesgos antes del lanzamiento, para que el equipo los parchee y añada barandillas. Piénsalo como una prueba de esfuerzo antes de que la IA salga en vivo.En resumen: el red teaming es contratar gente que piense y actúe como los malos, para que tropiecen con los agujeros antes de que tu IA se publique.
Comentarios