LuAITools.com
提交工具
⚖️AI
Darle a la IA una constitución escrita

IA constitucional

La IA constitucional, propuesta por Anthropic, entrega al modelo un conjunto de principios escritos y luego lo hace criticarse y corregirse contra ellos, ahorrando mucho etiquetado humano.

¿Qué es la IA constitucional?

La forma habitual de hacer que una IA sea segura y de buen comportamiento es que montones de humanos etiqueten qué debe y qué no debe decir: lento y caro. La IA constitucional de Anthropic le da la vuelta: primero entregas al modelo un conjunto de principios escritos, como una constitución, y luego haces que critique y revise su propia salida contra esos principios, reduciendo el etiquetado humano necesario.

¿Cómo funciona, a grandes rasgos?

Paso uno: el modelo se critica a sí mismo
Genera una respuesta normal y luego se le pide comprobarla contra la constitución: ¿es dañina, sesgada o se pasa de la raya?
Paso dos: reescribir a partir de la crítica
Entonces reescribe la respuesta para ajustarla mejor a los principios.
Paso tres: entrenar con los datos corregidos
Esos pares de crítica y reescritura se usan para entrenar al modelo, que interioriza los principios y acierta a la primera.

¿Qué hay escrito en la constitución?

Suele ser un lote de principios sacados de valores humanos o normas comunes: «elige la respuesta menos dañina para todos», «evita animar a actos ilegales», «da información objetiva y neutral», etcétera. Actúan como el código de conducta de la IA.

¿Qué problema resuelve?

Convierte la alineación de seguridad de puro etiquetado humano en «los humanos escriben las reglas, la IA las aplica»: más barato y mucho más escalable. Aunque lo buenas que sean esas reglas sigue dependiendo de quien las escribe.

En resumen: la IA constitucional le entrega al modelo una constitución escrita y hace que la use como espejo para revisarse y corregirse a sí mismo.

Comentarios