Categorías
Universitario Videojuego

Limpieza y calidad

Esta lección es importante porque la Minería de Datos no se trata sólo de obtener los datos, sino de poder garantizar su máxima fiabilidad, su máxima calidad, esto es: que estén limpios y bien organizados para representar la realidad de la forma más fidedigna posible.

Calidad

La calidad o «salud» del dato (data health) se mide por su exactitud, completitud, consistencia, validez y oportunidad (timeliness). No importa lo cuidadosos que seamos en el resto del proceso, si los datos entran corruptos o sesgados, el resultado no será válido (algunos a esto lo llaman principio GIGO: Garbage IN, Garbage OUT).

Limpieza

Los datos no suelen llegarnos de una manera perfecta. Para limpiar los datos lo primero es tratar los valores nulos (missing data) y para ello hay que distinguir cuando la ausencia de esos datos es al azar, es al azar condicionado o no es al azar y se debe a alguna relación causa-efecto. A veces lo más conveniente será eliminar los registros incompletos y otra será «imputar» valores que faltan calculándolos según algún criterio tipo la media, mediana, etc. de los valores vecinos.

Otra de las tareas de limpieza de datos es la relativa a detección y gestión de ruido y valores atípicos (outliers). Habrá que ver cuando esos valores atípicos son errores (ej. de lectura en un dispositivo físico, si se usa algo así para las telemetrías) o son valores legítimos. Se suelen usar métodos estadísticos para filtrar este «ruido» informativo.

Por último, limpiar los datos también implica corregir errores o inconsistencias en el formato (ej. unas filas con timestamps en un formato y otras en otro), eliminar duplicados… y verificar que no haya sesgos de recolección (lo que arruinaría la representatividad del conjunto). Hay que tener presente que existen muchos tipos de sesgos, sesgos de selección, temporales, geográficos, por plataforma, etc.

Ya hemos hablado de análisis exploratorio y visualización de información, y más allá, hablaremos de Aprendizaje Automático (AA)… porque la Minería de Datos es un campo muy amplio, que se puede o no ver complementado por procesos de AA. En Minería de Datos la importancia se la lleva el proceso completo o canalización (pipeline) que montamos, la exploración que realizamos de la realidad a estudiar, etc. y en esta fase lo que nos importa es que podamos confiar es los datos, que son la material prima con la que trabaja el científico de datos

Más información

Para complementar es recomendable consultar otros documentos.

  • …