Categorías
Universitario Videojuego

Inteligencia artificial generativa

En esta lección nos adentramos ya en las teorías más punteras que están transformando la producción, el diseño y el propio funcionamiento de las aplicaciones informáticas y los videojuegos.

Discriminar vs. Generar

Hablar de IA generativa implicar un «remapeo» mental de las arquitecturas vistas hasta ahora. Mientras que los modelos tradicionales aprenden P(Y|X), es decir, discriminar (clasificar, predecir….) si una entrada es de un tipo u otro, los modelos generativos aprenden la distribución de probabilidad subyacente P(X) para poder generar (sintetizar o como quiera llamarse) muestras completamente nuevas e inéditas de esa distribución.

Los llamados modelos de difusión (diffusion models) son la arquitectura estándar para generación de imagen o texturas (se usa en Stable Diffusion, Midjourney, etc.). Funcionan añadiendo ruido gaussiano progresivo a los datos y entrenando a la red para revertir el proceso («destruir el ruido») paso a paso.

Las redes generativas adversarias (GAN) que veíamos en la lección anterior usan la clásica dinámica del «falsificador» (generador) y el «policía» (discriminador), para ponerlos a competir entre sí. Y esto ha dado resultaod vitales para la síntesis de audio, texturas seamless y el upscaling.

Finalmente tenemos los Grandes Modelos de Lenguaje (los famosísimos Larga Language Models, LLMs), que son arquitecturas Transformer autorregresivas entrenadas para predecir el siguiente token, capaces de procesar y generar texto, código en diversos lenguajes de programación y estructuras de datos jerárquicas tipo JSON, XML y similares.

Asistencia al desarrollo

Actualmente ya está muy extendido el uso de modelos generativos para acelerar la escritura de scripts de motor (ya sea en juegos hechos en C# para Unity o con Blueprints o código C++ para Unreal), para hacer refactorización, optimización de algoritmos y pruebas unitarias automáticas.

También se usan mucho los modelos de difusión para iteración rápida de concept art, generación de variaciones de texturas tipo PBR y mapas de normales/rugosidad.

Cada vez tienen más fuerza herramientas emergentes de conversión de texto a malla 3D (Text-to-3D), síntesis de efectos de sonido procedimentales (SFX) y clonación de voz o lo que llaman «doblaje dinámico» (Text-to-Speech con emociones).

Presencia de IA generativa dentro del juego

Ya se están integrando LLMs en el bucle de juego para dotar a los NPCs de memoria a corto/medio plazo, personalidad y diálogo «libre» no guionizado, aunque sea necesario establecer bastantes barreras.

Se está trabajando enla integración con sistemas clásicos como FSMs o Behavior Trees, ya que no es razonable que únicamente un LLM controle el movimiento o la lógica crítica del personaje. El enfoque moderno combina la creatividad del LLM para el diálogo con árboles de comportamiento rígidos (y seguros) para las acciones físicas en el juego.

Se habla de Generación Procedimental Guiada por IA (AI-PCG o AI-ProcGen) a la idea de usar modelos de lenguaje o difusores adaptados para la creación automática de misiones (quests), puzles, diálogos ramificados o descripciones de objetos que reaccionan a las decisiones del jugador. Esto también tiene relación, por supuesto, con la Narración Digital Interactiva.

Desafíos actuales

Uno de los grandes problemas de usar IA generativa en videojuegos es la pérdida de control y de determinismo. Básicamente el problema que tienen todas las IAs con las alucinaciones. En videojuegos, la dirección artística y el diseño exigen control total… una forma de mitigar esta «peligrosa aleatoriedad» es mediante Prompt Engineering, Fine-Tuning, RAG (Retrieval-Augmented Generation) y ControlNet.

Los costes de inferencia y la latencia de API en la nube (cloud) suelen ser otro problema. La solución es plantear la ejecución de modelos pequeños cuantitizados (SLMs) directamente en la GPU del cliente/consola (es decir, localmente u on-device).

El debate ético sobre los datos de entrenamiento, los derechos de autor de los recursos generados, el impacto en el empleo de perfiles creativos júnior y los sesgos algorítmicos, aunque no sea técnico también es muy interesante y será relevante para el futuro de la industria.

A día de hoy muchos estudios trabajan en juegos multijugador masivos (GaaS – Games as a Service), por lo que hay que plantearse el Procesamiento de Lenguaje Natural (NLP) con Moderación Automática, es decir, usando modelos supervisados y transformers para la detección de toxicidad en chat de voz/texto, acoso y comportamiento antideportivo (griefing). También algo interesante es analizar los sesgos que pueda haber en la economía o a nivel de igualdad (Fairness), ya que existe el riesgo de que un modelo de fijación dinámica de precios o matchmaking discrimine o explote involuntariamente a jugadores vulnerables (p. ej., dinámicas de ludopatía con loot boxes).

Más información

Para complementar es recomendable consultar otros documentos.