Datos y análisis · revisado en julio de 2026
Limpieza de datos
La limpieza de datos (data cleaning) es el proceso de detectar y corregir valores faltantes, duplicados, mal formateados o inconsistentes en un conjunto de datos antes de analizarlo. Suele consumir la mayor parte del tiempo de un proyecto de análisis de datos real.
Preguntas frecuentes
¿Qué se hace con los valores faltantes (NaN)?
Depende del caso: se pueden eliminar las filas o columnas afectadas (dropna), rellenarlas con un valor razonable como la media o la mediana (fillna), o dejarlas explícitamente si el análisis las maneja bien.
¿Cómo se detectan filas duplicadas en pandas?
Con df.duplicated(), que marca las filas repetidas, y df.drop_duplicates() para eliminarlas.
¿Por qué es tan importante la limpieza antes de analizar?
Porque datos sucios producen conclusiones incorrectas silenciosamente — un promedio calculado con duplicados o valores mal escritos puede parecer válido sin serlo, sin ninguna señal de error.