数据增强是什么?
训练模型最缺的永远是数据——标注又贵又慢。数据增强(Data Augmentation)的思路很朴素:已有的每一份数据,能不能「一变多」?翻转一下图片、给句子换个说法、给音频加点噪声,就得到一批「本质相同、样子不同」的新样本,让模型见识更广、学得更牢。它为什么有用?
防止「死记硬背」数据太少,模型容易把训练样本硬背下来,一碰到新东西就露馅。增强后的多样样本逼它去学真正通用的规律。
让模型更「皮实」
看过各种变形、噪声、遮挡之后,模型对真实世界的干扰更有抵抗力。
花小钱办大事
不用再花大价钱去标注新数据,只需一点点计算量,就能把训练集规模翻几倍。
常见的增强手法
图像翻转、旋转、裁剪、调色、加噪声、模糊——一张猫的照片能变出几十张。
文本
同义替换、回译(翻译过去再翻译回来)、随机插入或删除、让大模型改写。
语音
变速、加背景噪声、改变音量,模拟不同录音环境。
它有什么坑?
增强不是越狠越好:改过头会让标签失真——比如把「6」旋转 180 度就变成了「9」。所以增强的强度必须和任务匹配,还得保证新样本的标签仍然正确。一句话记住:数据增强就是「把一份数据变出好几份」,用廉价的方式让模型见多识广、更抗干扰。
评论