¿Qué es la IA constitucional?
La forma habitual de hacer que una IA sea segura y de buen comportamiento es que montones de humanos etiqueten qué debe y qué no debe decir: lento y caro. La IA constitucional de Anthropic le da la vuelta: primero entregas al modelo un conjunto de principios escritos, como una constitución, y luego haces que critique y revise su propia salida contra esos principios, reduciendo el etiquetado humano necesario.¿Cómo funciona, a grandes rasgos?
Paso uno: el modelo se critica a sí mismoGenera una respuesta normal y luego se le pide comprobarla contra la constitución: ¿es dañina, sesgada o se pasa de la raya?
Paso dos: reescribir a partir de la crítica
Entonces reescribe la respuesta para ajustarla mejor a los principios.
Paso tres: entrenar con los datos corregidos
Esos pares de crítica y reescritura se usan para entrenar al modelo, que interioriza los principios y acierta a la primera.
¿Qué hay escrito en la constitución?
Suele ser un lote de principios sacados de valores humanos o normas comunes: «elige la respuesta menos dañina para todos», «evita animar a actos ilegales», «da información objetiva y neutral», etcétera. Actúan como el código de conducta de la IA.¿Qué problema resuelve?
Convierte la alineación de seguridad de puro etiquetado humano en «los humanos escriben las reglas, la IA las aplica»: más barato y mucho más escalable. Aunque lo buenas que sean esas reglas sigue dependiendo de quien las escribe.En resumen: la IA constitucional le entrega al modelo una constitución escrita y hace que la use como espejo para revisarse y corregirse a sí mismo.
Comentarios