Esta lección es importante porque con datos y modelos trabajaremos durante todo el curso.
Datos
Los datos son representaciones cuantitativas o cualitativas de los atributos de una cierta entidad. Estos atributos pueden ser numéricos (discretos o contínuos) o categóricos (nominales u ordinales). Muchas veces hay que trabajar con la información de entrada hasta convertirla en una representación con la que podamos trabajar, como transformar toda la información de telemetría de un casco de realidad virtual a vectores de características (feature vectors).
Los datos son simplemente eso, datos, y el término Big Data -tan popular hoy día- es sólo una forma de referirse a ellos cuando existen en grandes cantidades y su manejo se vuelve algo más complicado. Como se verá en el tema de la Minería de Datos, estos tienen su propio «ciclo de vida»: hay que adquirirlos, prepararlos debidamente en particiones, usarlos para el entrenamiento, para la validación y hasta para las pruebas finales.
Modelos
Los modelos son simplificaciones de fenómenos de la realidad que de alguna manera encierran un «patrón subyacente». Algunos modelos de los que hablaremos en este curso son los árboles de decisión, las redes neuronales artificiales, las máquinas de vectores de soporte, etc.
Entre las distintas clasificaciones que podemos realizar de los modelos, existen modelos paramétricos (inmutables y más rápidos) y modelos no paramétricos (se van desarrollando según tratan más datos, lo que los hace más flexibles).
Como la verdadera utilidad de un modelo no es tanto memorizar los problemas y soluciones del pasado sino «generalizar» ese conocimiento para ser capaces de resolver problemas desconocidos, el modelo «perfecto» será aquel que evite el sobreajuste (overfitting), prestando demasiada atención al ruido y las peculiaridades del conjunto de datos de entrenamiento, y también el infraajuste (underfitting), no llegando a «pillar» ni las generalizaciones más obvias entre los datos de entrada y la salida.
Partición de datos
Para realizar Aprendizaje Automático, tradicionalmente se suele realizar una partición de datos en tres partes. La primera se corresponde con los datos de entrenamiento, que sirven realmente para ajustar el modelo modificando sus parámetros. La segunda son los datos de validación, con los que medimos lo buena o mala que ha sido la fase de entrenamiento y que nos permite ajustar los hiperparámetros (llamados así porque no son parámetros del modelo, sino parámetros del proceso de aprendizaje que está por encima y que sí fueron establecidos por el desarrollador) para poder repetir el entrenamiento todas las veces que haga falta. La tercera partición contiene los datos de prueba, que deben guardarse en secreto para usarse únicamente al final del proceso de aprendizaje, para dar una medida realista final sobre la calidad del sistema obtenido.
Para que la manera en que hacemos esta partición no afecte demasiado al resultado, existe la técnica de la validación cruzada (cross-validation) que, por ejemplo, divide todos los datos de entrenamiento y validación en k particiones (k-fold cross-validation) y repite el proceso de aprendizaje k veces, eligiendo un bloque de validación distinto cada vez. De esta manera es el promedio de todas las validaciones el que se utiliza para decidir cómo cambiar hiperparámetros.
De todas formas, cuidado con «jugar» con las distintas particiones de datos porque voluntaria o involuntariamente podríamos incurrir en una fuga de datos (data leakage), introduciendo en la entrada del proceso información que en realidad sólo debería ser información de salida.
Uso de datos y modelos
Los datos reales nunca son perfectos ni apuntan de manera determinista a un sólo modelo perfecto. Por eso es importante entender los conceptos de ruido y variabilidad, además de trabajar con otros términos estándar, como es el espacio de características (features), un espacio matemático multidimensional donde cada dimensión se corresponde con una de las características con las que trabajarán los modelos (siendo estas una variable o atributo de la realidad de las entidades con que trabajamos). Cada muestra (sample) es la unidad mínima de observación, un punto concreto en ese espacio de características multidimensional (ej. una fila en una hoja de cálculo).
Más información
Para complementar es recomendable consultar otros documentos.
- …
Esta página está licenciada bajo CC BY-NC-SA 4.0 por Laboratorios Narratech.