宪法AI是什么?
想让 AI 变安全、有分寸,传统做法是让大量人来标注「什么该说、什么不该说」,费时又费钱。Anthropic 提出了「宪法AI」(Constitutional AI):先给模型一套写成文字的原则——就像一部宪法——再让它对照这些原则自我审查、自我修正,减少对人工标注的依赖。它大概怎么运作?
第一步:让模型自我批评模型先正常生成回答,然后被要求对照「宪法」检查:这个回答有没有伤害人、有没有偏见、有没有越界?
第二步:根据批评重写
模型再根据这些批评,把回答改得更符合原则。
第三步:用改好的数据训练
把这一轮「批评—重写」的数据拿去训练模型,让它把原则内化,下次一开始就做对。
「宪法」里写什么?
通常是一批来自人类价值观或通用规范的原则,比如「请选择对各方最无害的回答」「避免鼓励违法行为」「给出客观中立的信息」等等。这些原则就相当于 AI 的行为准则。它解决了什么问题?
它把「安全对齐」这件事,从纯人工标注变成了「人工定原则、AI 来执行」,成本更低、可扩展性更强。当然,原则本身写得够不够好,依然取决于人。一句话记住:宪法AI就是先给AI立一部「成文宪法」,再让它拿宪法当镜子,自己照、自己改。
评论