Esta lección es importante porque la Minería de Datos podría ser de por sí una asignatura entera. En esta lección no se trata sólo de obtener los datos, sino de poder garantizar su máxima fiabilidad, su máxima calidad, esto es: que representen la realidad de la forma más fidedigna posible.
Adquisición
Lo primero es conocer el origen de los datos, para ver que es fiable y lo más preciso posible. Si los datos se obtienen de un entorno interactivo, pueden capturarse en tiempo real tratando de no penalizar el rendimiento, o usar buffers para capturarlos por lotes en hilos secundarios. También es importante tener en cuenta si es necesaria su integración desde distintas fuentes.
Calidad
La calidad o «salud» del dato (data health) se mide por su exactitud, completitud, consistencia, validez y oportunidad (timeliness). No importa lo cuidadosos que seamos en el resto del proceso, si los datos entran corruptos o sesgados, el resultado no será válido (algunos lo llaman principio GIGO: Garbage IN, Garbage OUT).
Limpieza
Los datos no suelen llegarnos de una manera perfecta. Para limpiar los datos lo primero es tratar los valores nulos (missing data) y para ello hay que distinguir cuando la ausencia de esos datos es al azar, es al zar condicionado o no es al azar y se debe a alguna relación causa-efecto. A veces lo más conveniente será eliminar los registros incompletos y otra será «imputar» valores que faltan calculándolos según algún criterio tipo la media, mediana, etc. de los valores vecinos.
Otra de las tareas de limpieza de datos es la relativa a detección y gestión de ruido y valores atípicos (outliers). Habrá que ver cuando esos valores atípicos son errores (ej. de lectura en un dispositivo físico, si se usa algo así para las telemetrías) o son valores legítimos. Se suelen usar métodos estadísticos para filtrar este «ruido» informativo.
Por último, limpiar los datos también implica corregir errores o inconsistencias en el formato (ej. unas filas con timestamps en un formato y otras en otro), eliminar duplicados… y verificar que no haya sesgos de recolección (lo que arruinaría la representatividad del conjunto). Hay que tener presente que existen muchos tipos de sesgos, sesgos de selección, temporales, geográficos, por plataforma, etc.
Más adelante hablaremos de análisis exploratorio y visualización de información, y más allá, de aprendizaje automático… porque la Minería de Datos es un campo muy amplio, sobre el que se puede o no realizar procesos de aprendizaje automático. En Minería de Datos la importancia se la lleva el proceso completo (pipeline) que montamos, la exploración que realizamos de la realidad a estudiar, etc. y en esta fase lo que nos importa es que podamos confiar es los datos, que son la material prima con la que trabajamos.
Más información
Para complementar es recomendable consultar otros documentos.
- …
Esta página está licenciada bajo CC BY-NC-SA 4.0 por Laboratorios Narratech.