Esta lección es importante porque no es raro acabar trabajando con espacios multidimensionales con un número tan alto de dimensiones que no es viable trabajar con él hasta que no lo reduzcamos. El problema de la dimensionalidad Lo que algunos llaman también la maldición de la dimensionalidad (curse of dimensionality) es un problema que presentan […]
Etiqueta: Inteligencia Artificial
Agrupamiento
Cuando el aprendizaje es no supervisado, ya no hay etiquetas y por lo tanto los algoritmos (como los de agrupamiento) tienen que «descubrir» por sí mismos la estructura «latente» en los propios datos… se podría decir que son algoritmos de descubrimiento, lo cual es muy útil para segmentar clientes en el mundo del marketing o […]
Redes neuronales artificiales
Para sentar las bases de lo que luego se llamará «Aprendizaje Profundo» y veremos al final del curso, terminamos el tema abordando las redes neuronales artificiales. Perceptrón Las redes neuronales artificiales (ANN, Artificial Neural Networks) se inspiran en cierto modo en las redes neuronales naturales, las biológicas que se encuentran en nuestro cerebro y en […]
Un buen científico de datos no se conforma con los modelos más básicos sino que trata de diagnosticar posibles fallos, exprimir el rendimiento de dichos modelos a tope y, si hace falta, combinar varios modelos para crear sistemas altamente precisos. Diagnóstico de modelos Una vez vistos temas de regresión lineal y demás… hay que saber […]
Modelos no lineales
Como en la práctica la realidad no suele tener la forma de una recta perfecta, aquí empezamos a introducir herramientas que permiten capturar «fronteras de decisión» curvadas, discontinuas y complejas. Árboles de decisión Si recordáis lo que es un árbol de decisión en Inteligencia Artificial clásica (los que vemos en la asignatura de Inteligencia Artificial […]
En esta lección seguimos trabajando en la base teórica y matemática indispensable para realizar aprendizaje supervisado, algoritmos transparentes y rápidos para entender la geometría del espacio de características. Regresión lineal Hablamos de regresión lineal simple cuando sólo tenemos una variable de entrada, y múltiple si tenemos varias. Por ejemplo, podríamos intentar predecir cuanto tardará un […]
Regresión y clasificación
Cuando pasamos de manipular datos a empezar a construir modelos hay que hablar de dos conceptos clave en los modelos predictivos: la regresión y la clasificación. El aprendizaje supervisado comprende una gran variedad de aplicaciones, desde el reconocimiento de imágenes hasta la predicción de valoraciones en bolsa o la traducción automática. Sin embargo, desde un […]
En esta lección conocemos las metodologías estándar para construir proyectos de Minería de Datos. Los procesos de Minería de Datos nunca son lineales: los hallazgos en la fase de modelado o de evaluación suelen obligar a redefinir el problema y quizá volver al preprocesado de datos. Aún así existen metodologías estándar que explican el ciclo […]
Aunque tengamos datos en gran cantidad, es necesario cierto trabajo para poder «comprenderlos» y eso implicar realizar ciertos análisis y poder visualizarlos de alguna manera. El análisis exploratorio de datos (EDA, Exploratory Data Analysis) tiene como objetivo entender «la forma» de los datos antes de hacer cualquier procesamiento con ellos. Es posible identificar anomalías, lanzarse […]
Preprocesado y transformación
En esta lección se asume que contamos ya con datos correctos (hasta cierto punto) y ahora la tarea consiste es prepararlos para que los algoritmos puedan trabajar con ellos. Aunque bibliotecas como Scikit-Learn (alias Sklearn) son famosas por sus modelos predictivos, esta tiene un módulo excelente de preprocesamiento (sklearn.preprocessing). Para practicar con Python, en este […]