LuAITools.com
提交工具
🧬AI
Data Augmentation

数据增强

数据增强通过翻转、旋转、加噪、改写、合成等方式,把一份数据变出好几份「长得像又不一样」的新样本,是小数据集和贵数据时代最划算的省钱术之一。

数据增强是什么?

训练模型最缺的永远是数据——标注又贵又慢。数据增强(Data Augmentation)的思路很朴素:已有的每一份数据,能不能「一变多」?翻转一下图片、给句子换个说法、给音频加点噪声,就得到一批「本质相同、样子不同」的新样本,让模型见识更广、学得更牢。

它为什么有用?

防止「死记硬背」
数据太少,模型容易把训练样本硬背下来,一碰到新东西就露馅。增强后的多样样本逼它去学真正通用的规律。
让模型更「皮实」
看过各种变形、噪声、遮挡之后,模型对真实世界的干扰更有抵抗力。
花小钱办大事
不用再花大价钱去标注新数据,只需一点点计算量,就能把训练集规模翻几倍。

常见的增强手法

图像
翻转、旋转、裁剪、调色、加噪声、模糊——一张猫的照片能变出几十张。
文本
同义替换、回译(翻译过去再翻译回来)、随机插入或删除、让大模型改写。
语音
变速、加背景噪声、改变音量,模拟不同录音环境。

它有什么坑?

增强不是越狠越好:改过头会让标签失真——比如把「6」旋转 180 度就变成了「9」。所以增强的强度必须和任务匹配,还得保证新样本的标签仍然正确。

一句话记住:数据增强就是「把一份数据变出好几份」,用廉价的方式让模型见多识广、更抗干扰。

评论