LuAITools.com
提交工具
🧬AI
集めずに訓練データを増やす

データ拡張

データ拡張は、反転・回転・ノイズ付加・書き換え・合成などで、1つのデータを「似ているが同じではない」複数の新サンプルに増やします。データが少なく高価な時代に、最もお得な節約術のひとつです。

データ拡張って何?

モデル訓練でいつも足りないのはデータ。しかもラベル付けは遅くて高い。データ拡張の考え方はシンプルです。手元のデータを「1つから複数へ」できないか?画像を反転し、文を言い換え、音声にノイズを足せば、「中身は同じ、見た目は違う」新しいサンプルが手に入ります。モデルの見聞を広げ、学習を確かにします。

なぜ役に立つ?

丸暗記を防ぐ
データが少ないと、モデルは訓練例を暗記し、新しい入力で破綻します。多様な拡張サンプルが、本当に汎用する規則を学ばせます。
モデルを丈夫にする
変形・ノイズ・遮蔽を見た後では、実世界の乱れにも強くなります。
少ないコストで大きく
新しいデータのラベル付けにお金をかけず、少しの計算で訓練セットを数倍にできます。

よくある手法

画像
反転、回転、切り抜き、色調整、ノイズ、ぼかし。猫の写真1枚が数十枚になります。
テキスト
同義語への置換、逆翻訳(翻訳して戻す)、ランダムな挿入・削除、モデルによる書き換え。
音声
速度変更、背景ノイズ、音量変化で、異なる録音環境を再現します。

落とし穴は?

強ければいいわけではありません。やりすぎるとラベルが嘘になります——「6」を180度回せば「9」です。拡張の強さはタスクに合わせ、新しいサンプルのラベルが正しいままである必要があります。

まとめ:データ拡張は「1つのデータを複数に増やす」こと。安い方法でモデルの見聞を広げ、ノイズに強くします。

コメント