データクレンジングって何?
現実のデータは、決して整然としていません。表には重複行、空欄、バラバラな日付、単位の合わない数字があります。データクレンジングは訓練前の「米をとぐ」工程。石や砂、傷んだ粒を取り除き、使える部分だけを残します。何を掃除する?
重複データ同じサンプルが何度も出ると、モデルは特定パターンを過度に覚え、偏りが生まれます。
欠損と外れ値
空の項目、ありえない数値(年齢が200歳など)は、補うか除くかします。
形式と文字コード
日付の書き方がまちまち、全角半角の混在、文字化け。すべて統一が必要です。
ノイズと誤ラベル
間違ったラベルや無関係な情報が混ざると、モデルを直接誤らせます。
なぜ軽く見られがち?
「より強いモデル」を信じる人は多いのに、「よりきれいなデータ」は見落とされがち。実際は、データが悪ければ、モデルが強くても救えません。経験のあるチームは「データを洗う時間はモデル調整より長いが、その見返りは確実」と言います。よくある流れ
まずツールで自動の重複除去と形式統一。次にルールと人の抜き取りで厄介なデータを処理。最後に統計で分布が妥当かを検証します。最近は大規模モデルに「洗わせる」チームも増えましたが、微妙な判断は人が握ります。まとめ:データクレンジングは「ゴミデータ」を訓練の外に置くこと。データがきれいなほど、モデルは頼りになります。
コメント