Categorías
Universitario Videojuego

Modelos lineales y probabilísticos

En esta lección seguimos trabajando en la base teórica y matemática indispensable para realizar aprendizaje supervisado, algoritmos transparentes y rápidos para entender la geometría del espacio de características.

Regresión lineal

Hablamos de regresión lineal simple cuando sólo tenemos una variable de entrada, y múltiple si tenemos varias. Por ejemplo, podríamos intentar predecir cuanto tardará un jugador en subir de nivel teniendo en cuenta su nivel actual y el valor de los objetos de su inventario.

La idea central para resolver estos problemas siempre es la misma: asumir que existe una relación lineal entre la variable (o las variables) de entrada, X, y la variable continua que queremos predecir, y. Esto implica que asumimos como verdadera esta expresión, siendo las w los distintos pesos a encontrar: y = w0 + w1 x1 + w2 x2 + … + wn xn

Ajuste por Mínimos Cuadrados Ordinarios (OLS): Esta técnica consiste en encontrar geométricamente el hiperplano que minimiza la suma de las distancias cuadráticas verticales entre los puntos reales (los correctos) y la predicción.

Regresión logística

Aunque lleva «regresión» en el nombre, en realidad el algoritmo que vamos a contar para resolver regresión logística es más un algoritmo de clasificación. Consiste en tomar una combinación lineal de las entradas y pasarla por la función sigmoide (también llamada «función logística») para acotar la salida estrictamente entre 0 y 1. De ese modo hemos convertido el resultado de una combinación lineal a una probabilidad de que la observación pertenezca a la clase sobre la que nos estamos preguntando.

Hay lo que se conoce como una frontera de decisión lineal que define un hiperplano llano que divide el espacio de características en dos regiones. Esto sirve, por ejemplo, para predecir la probabilidad de que un jugador haga una compra en las próximas 24 horas en función de variables de entrada que describen su actividad en el juego.

Regularización

Cuando tenemos muchas variables (o hay mucha multicolinearidad, variables con información muy redundante), los modelos lineales se vuelven inestables y sufren de sobreajuste (overfitting), asignando pesos GIGANTESCOS a ciertas características. Estas son algunas soluciones para ese problema.

Penalización L2 (Ridge): Añade un término proporcional al cuadrado de los pesos. Esto reduce la magnitud de todos los coeficientes sin anular ninguno, suavizando la respuesta.

Penalización L1 (Lasso): Añade un término proporcional al valor absoluto de los pesos. Esto funciona como un selector automático de características, forzando a que los coeficientes menos relevantes sean exactamente cero.

Clasificación probabilística

Esta es la famosa clasificación Naive Bayes, llamada así porque aprovecha el Teorema de Bayes. Este teorema básicamente consiste en la idea intuitiva de actualizar una creencia inicial cuando aparece nueva información (nos dice qué probabilidad tiene ahora una determinada hipótesis dado que acabamos de observar unas nuevas evidencias). Concretamente calcula la probabilidad a posteriori de una clase Ck dadas unas variables observadas X, sabiendo que lo que se quiere calcular P(Ck|X) es proporcional (lo mismo, multiplicado por una constante) A la probabilidad inicial P(Ck) multiplicada por el productorio de P(xi​ ∣ Ck​) para i desde 1 hasta n.

Se llama Naive Bayes porque hay una suposición ingenua («naive») que es asumir que todas las características son condicionalmente independientes entre sí dada la clase. Aunque esto casi nunca se cumple en el mundo real, el algoritmo funciona sorprendentemente bien en la práctica. Es un algoritmo que se usa típicamente para filtrar SPAM y cosas así, porque tiene muy poco coste computacional.

Más información

Para complementar es recomendable consultar otros documentos.