Lanzada por Valve en septiembre de 2003, Steam pasó de ser una simple plataforma de actualización para Counter-Strike a convertirse en el ecosistema de distribución digital de PC más grande del mundo. Con más de 130 millones de usuarios activos mensuales y decenas de miles de títulos en su catálogo, Steam no solo mueve miles de millones de dólares al año, sino que registra segundo a segundo el comportamiento, las preferencias y los hábitos de consumo de una importantísima comunidad global de jugadores.
In God we trust; all others must bring data.
W. Edwards Deming (1900-1993)
Para cualquier científico de datos -más aún si es alguien interesado en el desarrollo de videojuegos- el catálogo de Steam representa un enorme yacimiento de información. Aplicar técnicas de Minería de Datos sobre esta plataforma (adquiriendo, limpiando, transformando, analizando y visualizando su valiosa información) es un trabajo real que deben realizar los estudios para entender la saturación del mercado, identificar nichos de oportunidad, ajustar precios y predecir la recepción del público antes de poner en marcha un proyecto.
Propuesta
La práctica consiste en realizar un estudio del mercado de Steam, recorriendo todas las fases de la Minería de Datos para adquirir, limpiar, transformar y sobre todo analizar a fondo un conjunto de datos extraído del catálogo de Steam, con la finalidad de obtener una conclusiones que pueden ser valiosas para un futuro proyecto de videojuego para PC.
El punto de partida es el repositorio de GitHub llamado Market Base que contiene como Release un conjunto de datos (games.csv) descargado de la página web en Kaggle de Steam Games Dataset.
Los bloques principales del estudio a realizar son:
A. Adquisición correcta del conjunto de datos y exploración inicial del mismo hasta confirmar que la estructura está bien alineada.
B. Valoración de la calidad de los datos, limpieza exhaustiva de los mismos (mediante tratamiento de nulos, transformación de cadenas de texto en listas, etc.) y creación de nuevas características interesantes como por ejemplo la tasa de valoraciones positivas (sólo para juegos con más de 50 reseñas).
C. Análisis de los géneros de videojuego más frecuentes en relación con el volumen estimado de jugadores. Análisis de la distribución de precios en videojuegos incluyendo estadísticas principales, identificando las horquillas de precio más habituales. Discusión razonada de todos los resultados y visualización mediante gráficas adecuada para cada caso.
D. Análisis de correlaciones entre el precio y el éxito del videojuego. Análisis temporal de los lanzamientos por año que ha habido en la plataforma. Discusión razonada de todos los resultados y visualización mediante gráficas adecuada para cada caso.
E. Identificación de nichos de oportunidad en el mercado (por ejemplo, mediante la búsqueda de combinaciones de géneros poco saturadas pero con altas tasas de valoración positiva, u otro análisis avanzado a elegir por el grupo) y redacción de las conclusiones generales de todo el estudio.
Revisión
Tener el repositorio a disposición del profesor, en formato entregable, preparado en tiempo y forma por todos los miembros del grupo de manera equitativa, supone un 10% de la nota de la práctica. El profesor tendrá una lista con los datos de todos los grupos y los enlaces a las organizaciones en GitHub (por ejemplo AAM23-G02, la del grupo 2 del curso Aprendizaje Automático y Minería de Datos 2023-2024) donde se encontrarán los repositorios de las prácticas (por ejemplo AAM23-G02-P0).
Revisión preliminar
En esta primera fase de revisión hay un único entregable:
- Cuaderno interactivo incompleto (sin resultados, discusión ni conclusiones) en formato IPYNB, siguiendo la estructura recomendada por el profesor y presentada en el README.md. Supone un 10% de la nota.
Revisión final
En esta segunda fase de revisión el entregable es el mismo:
- Proyecto con todos los ficheros de la implementación, generalmente datos en formato CSV, cuaderno interactivo completo (con documentación, código fuente y resultados) en formato IPYNB, y si es necesario en alguna práctica recursos de Unity y C# (el proyecto se llamará AAM23-G02-P0). Supone un 20% de la nota. La documentación tiene tantas secciones como bloques el estudio (esto es A, B, C, D y E). Supone un 10% de la nota. Cada bloque del estudio (A, B, C, D y E) correctamente realizado y razonado supone un 10% de la nota, sumando un total de 50%.
Más información
Además de la bibliografía recomendada, se pueden investigar las siguientes referencias. En ningún caso se debe replicar código de terceros o de IA sin entenderlo bien y «hacerlo nuestro», y siempre asegurándonos de que funciona exactamente como se requiere en esta práctica.
Se pueden realizar ampliaciones para ir más allá en el aprendizaje.
- Descarga la versión extendida del conjunto de datos (games.json) de la página web en Kaggle de Steam Games Dataset y trabaja sobre ella.
- Analiza relaciones entre precio y popularidad, entre gratuidad o no y número de reseñas, entre géneros y tiempo de juego, entre plataformas soportadas y características ofrecidas, etc.
- Analiza correlaciones entre el precio y la plataforma, la evolución de los géneros por año, entre los idiomas del juego y las reseñas, etc.
- Prueba a crear gráficas interactivas con Plotly Express (import plotly.express as px).
Esta página está licenciada bajo CC BY-NC-SA 4.0 por Laboratorios Narratech.