数据清洗是什么?
现实世界的数据,从来不是整整齐齐的。表格里有重复行、有空缺、有格式混乱的日期、有单位不统一的数字。数据清洗,就是训练前的那道「淘米」工序——把石子、泥沙和坏米粒挑出去,只留下能用的部分。它要清理哪些「脏东西」?
重复数据同一份样本出现多次,会让模型对某些模式「过目不忘」,产生偏差。
缺失与异常值
空着的字段、离谱的数值(比如年龄填成 200 岁),要么补全,要么剔除。
格式与编码问题
日期写法五花八门、全角半角混用、乱码,都得统一。
噪声与错误标签
错误标注、无关信息混进来,会直接误导模型。
为什么它常被低估?
很多人迷信「更牛的模型」,却忽略了「更干净的数据」。实际上,数据质量差,模型再强也救不回来。有经验的团队常说:花在洗数据上的时间,往往比调模型还多,回报却更实在。清洗的常见套路
先用工具做自动去重、格式统一,再靠规则和人工抽查处理脏数据,最后做统计分析验证分布是否合理。现在越来越多团队让大模型帮忙「洗」,但关键的边界还是得人来定。一句话记住:数据清洗就是把「垃圾数据」挡在训练门外。数据有多干净,模型就有多靠谱。
评论