合成データって何?
簡単に言うと、AIが自ら「作り出す」データです。実データから規則を学んだあと、同じ構造・同じ分布で「本物そっくりの新データ」を大量に生成します。でも中身に実在の人物や出来事はありません。実写写真で顔生成モデルを訓練し、存在しない顔を無限に作るようなものです。なぜ「偽データ」が必要?
実データは高くて手に入らない医療画像、金融取引、希少疾患の症例。足りないか、プライバシー規制で使えないかのどちらかです。
コンプライアンスのリスク
実ユーザーのデータで訓練すれば、漏えいは大問題。合成データには実在の個人情報がないので、多くの問題を最初から避けられます。
欲しいデータを狙って作れる
「雨の日の事故」を認識するモデルを育てたいのにサンプルがない? それなら雨の日の事故画像を何千枚でも生成できます。
どう作る?
よくあるのは、モデルに実データの分布を学ばせ、生成モデル(拡散モデルやGAN)で大量に生産する方法。大規模モデルがルールに従って合成テキストを「書いて」、小型モデルの訓練に使うこともあります。限界
合成データはいくら本物らしくても、実データから「規則を写した」もの。元データに偏りがあれば、その偏りはそのまま増幅されます。頼りすぎるとモデルは「自分でグルグル回る」ようになり、作り出した幻覚ばかり覚えてしまいます。まとめ:合成データはAIが自ら作る偽データ。プライバシーの面倒は省けますが、「偽物で本物を鍛える」リスクも背負います。
コメント