LuAITools.com
提交工具
🧰AI
Limpiar antes de entrenar

Limpieza de datos

La limpieza de datos es la limpieza a fondo previa al entrenamiento: quitar duplicados, ruido y errores para convertir datos desordenados en un conjunto limpio que el modelo pueda digerir sin sustos.

¿Qué es la limpieza de datos?

Los datos del mundo real nunca están ordenados. Las hojas llegan con filas duplicadas, celdas vacías, fechas en cinco formatos distintos y números en unidades que no cuadran. La limpieza de datos es el paso de «lavar el arroz» antes de cocinar: sacar piedras, arenilla y granos malos, y quedarte solo con lo aprovechable.

¿Qué porquería limpia?

Duplicados
La misma muestra repetida hace que el modelo memorice de más ciertos patrones, y eso lo sesga.
Valores ausentes y atípicos
Celdas vacías o cifras absurdas — como una edad de 200 — hay que rellenarlas o descartarlas.
Problemas de formato y codificación
Fechas escritas de mil maneras, caracteres de ancho completo y medio mezclados, mojibake: todo debe normalizarse.
Ruido y etiquetas mal puestas
Etiquetas erróneas o basura irrelevante que se cuela desvían al modelo.

¿Por qué se la subestima?

Mucha gente venera «un modelo más grande» e ignora «datos más limpios». En la práctica, un modelo potente no rescata datos malos. Los equipos con experiencia dicen que suelen pasar más tiempo limpiando que ajustando el modelo, y la recompensa es más fiable.

Cómo suele hacerse

Primero deduplicación y normalización de formatos automatizadas; luego reglas y revisiones humanas por muestreo para los casos feos; y al final algo de estadística para confirmar que la distribución sigue teniendo sentido. Cada vez más equipos dejan que los modelos grandes ayuden a fregar, pero los límites delicados los pone la gente.

En resumen: la limpieza de datos deja la basura fuera del entrenamiento. Cuanto más limpios los datos, más fiable el modelo.

Comentarios