LuAITools.com
提交工具
⚖️AI
AIに成文憲法を与える

憲法AI(Constitutional AI)

憲法AIはAnthropicが提唱した方法。まずAIに文章化された「憲法の原則」を与え、それに照らして自己批判・自己修正させます。大量の人手によるラベル付けを省けます。

憲法AI(Constitutional AI)って何?

AIを安全で分別あるものにする従来の方法は、多くの人に「何を言っていいか」をラベル付けさせること。時間もお金もかかります。Anthropicの「憲法AI」はこれをひっくり返し、まずモデルに文章化された原則、いわば憲法を与え、それに照らして自分で自己批判・自己修正させます。人のラベル付けを大幅に減らせるのです。

どう動くのか

第一歩:自己批判させる
モデルはまず普通に回答を生成し、それを憲法に照らして点検します。害はないか、偏りはないか、一線を越えていないか。
第二歩:批判をもとに書き直す
その批判を踏まえ、原則により合うよう回答を書き直します。
第三歩:書き直したデータで訓練する
「批判と書き直し」のデータでモデルを訓練し、原則を内面化させます。次から最初から正しくできるように。

憲法には何が書いてあるのか

人間の価値観や一般常識から来る原則が並びます。「すべての当事者に最も無害な回答を選ぶ」「違法行為を促さない」「客観的で中立的な情報を出す」など。これらがAIの行動規範になります。

何を解決するのか

安全へのアラインメントを、「人が全部ラベル付け」から「人が原則を決め、AIが実行する」へ変えます。コストは下がり、拡張性は高まる。ただし原則そのものが良く書けているかは、やはり人にかかっています。

まとめ:憲法AIは、AIに「成文憲法」を渡し、それを鏡にして自分で点検し、自分で直させる方法です。

コメント