¿Qué es la limpieza de datos?
Los datos del mundo real nunca están ordenados. Las hojas llegan con filas duplicadas, celdas vacías, fechas en cinco formatos distintos y números en unidades que no cuadran. La limpieza de datos es el paso de «lavar el arroz» antes de cocinar: sacar piedras, arenilla y granos malos, y quedarte solo con lo aprovechable.¿Qué porquería limpia?
DuplicadosLa misma muestra repetida hace que el modelo memorice de más ciertos patrones, y eso lo sesga.
Valores ausentes y atípicos
Celdas vacías o cifras absurdas — como una edad de 200 — hay que rellenarlas o descartarlas.
Problemas de formato y codificación
Fechas escritas de mil maneras, caracteres de ancho completo y medio mezclados, mojibake: todo debe normalizarse.
Ruido y etiquetas mal puestas
Etiquetas erróneas o basura irrelevante que se cuela desvían al modelo.
¿Por qué se la subestima?
Mucha gente venera «un modelo más grande» e ignora «datos más limpios». En la práctica, un modelo potente no rescata datos malos. Los equipos con experiencia dicen que suelen pasar más tiempo limpiando que ajustando el modelo, y la recompensa es más fiable.Cómo suele hacerse
Primero deduplicación y normalización de formatos automatizadas; luego reglas y revisiones humanas por muestreo para los casos feos; y al final algo de estadística para confirmar que la distribución sigue teniendo sentido. Cada vez más equipos dejan que los modelos grandes ayuden a fregar, pero los límites delicados los pone la gente.En resumen: la limpieza de datos deja la basura fuera del entrenamiento. Cuanto más limpios los datos, más fiable el modelo.
Comentarios