データ拡張って何?
モデル訓練でいつも足りないのはデータ。しかもラベル付けは遅くて高い。データ拡張の考え方はシンプルです。手元のデータを「1つから複数へ」できないか?画像を反転し、文を言い換え、音声にノイズを足せば、「中身は同じ、見た目は違う」新しいサンプルが手に入ります。モデルの見聞を広げ、学習を確かにします。なぜ役に立つ?
丸暗記を防ぐデータが少ないと、モデルは訓練例を暗記し、新しい入力で破綻します。多様な拡張サンプルが、本当に汎用する規則を学ばせます。
モデルを丈夫にする
変形・ノイズ・遮蔽を見た後では、実世界の乱れにも強くなります。
少ないコストで大きく
新しいデータのラベル付けにお金をかけず、少しの計算で訓練セットを数倍にできます。
よくある手法
画像反転、回転、切り抜き、色調整、ノイズ、ぼかし。猫の写真1枚が数十枚になります。
テキスト
同義語への置換、逆翻訳(翻訳して戻す)、ランダムな挿入・削除、モデルによる書き換え。
音声
速度変更、背景ノイズ、音量変化で、異なる録音環境を再現します。
落とし穴は?
強ければいいわけではありません。やりすぎるとラベルが嘘になります——「6」を180度回せば「9」です。拡張の強さはタスクに合わせ、新しいサンプルのラベルが正しいままである必要があります。まとめ:データ拡張は「1つのデータを複数に増やす」こと。安い方法でモデルの見聞を広げ、ノイズに強くします。
コメント