La comunicación en lenguaje natural siempre ha sido uno de los sueños de la IA, y en videojuegos, aunque no haya cosechado grandes éxitos, tenemos ejemplos de uso de estas tecnología.
Tradicionalmente los videojuegos se han visto beneficiados de incluir muchas y muy variadas voces pregrabadas (ej. las de Hades 2). Se cuenta la anécdota de que la calidad que los jugadores atribuían a la IA de Halo aumentó notablemente… simplemente añadiendo voces a los enemigos.
Sin embargo, actualmente al hablar de PLN parece obligatorio tratar el tema de los grandes modelos de lenguaje (LLMs) como GPT. Estos sistemas han demostrado que existen relaciones estadísticas entre unos elementos de una frase y los siguientes, y son capaces de sacar provecho a esas relaciones para realizar un sinfín de tareas conversacionales. Muchas personas se preguntan por los límites éticos de unas herramientas que han aprendido trabajando con muchas creaciones humanas que tienen derechos de autor… aunque sus creadores argumentan que no se «roban» textos ni imágenes, ni se memorizan o representan internamente, sino que simplemente se estudian y lo que se almacena son redes neuronales artificiales que capturan esas complejas relaciones identificadas tras considerar millones de textos e imágenes.
Reconocimiento del habla
Para convertir la voz a texto tradicionalmente había 3 fases, que sigue habiéndolas aunque el entrenamiento sea mucho más eficaz ahora:
- Decodificador acústico-fonético. Sirve para clasificar los sonidos fonéticamente. Al empezar la onda dibuja en el espectro de frecuencias una serie de zonas con mayor intensidad, son los llamados formantes, lo que permite distinguir una vocal de otra, una consonante de otra, etc. (varían mucho: ej. los niños tienen la voz más aguda, hay acentos y voces muy distintas, etc.). La diferencia y relación entre las 3 frecuencias predominantes, a pesar de las variaciones, es lo que denota qué se está recibiendo.
- Entrenamiento. Usando alguna técnica de aprendizaje máquina (actualmente redes neuronales artificial con arquitectura de atención) se entrena al sistema para que asocie muestras de voz a ciertos textos. Esto es lo más pesado a nivel computacional y donde se requiere más información para el sistema. Como resultado se generan los llamados modelos acústicos y del lenguaje, que pueden ser individualizados y cuanto más se entrenen, mejor distinguirá voces, tendrá más léxico, comprenderá más pronunciaciones, será más tolerante al ruido, etc.
- Reconocimiento. Se usan los modelos anteriores para comparar entradas que van llegando y obtener así el texto resultante.
Comprensión del lenguaje natural
La arquitectura típica para este procesamiento estaba formada por 4 etapas:
- Análisis morfológico y sintáctico. Esta primera etapa, dividida en dos niveles, nos devuelve si la oración proporcionada por el usuario posee palabras correctas, descartando palabras inventadas o no existentes en el idioma y asegurándose una estructura sintáctica correcta.
- Análisis semántico y pragmático. A continuación, se realiza el análisis semántico, para obtener el significado puro de la oración, pudiendo ser testeada mediante expresión booleana (cierto/falso). Finalmente, se realiza el nivel de análisis pragmático, donde se alinea el análisis de la oración introducida con el conjunto de oraciones, así como la relación entre ellas, y la situación de las mismas.
Más información
Para complementar es recomendable consultar otros documentos:
- Brat, C.: The System Behind Hades’ Astounding Dialogue. People Make Games. YouTube (2020)
- Korb, D., Kasavin, G.: Breathing Life into Greek Myth: The Dialogue of ‘Hades’. GDC. YouTube (2021)
- Ringa Tech. Cómo ChatGPT dió vida a un pueblo virtual (2023)
- Ruskin, E.: AI-driven Dynamic Dialog through Fuzzy Pattern Matching. GDC. YouTube (2018)
- Thompson, T.: How Barks Make Videogame NPCs Look Smarter | AI 101. AI and Games. YouTube (2022)
Esta página está licenciada bajo CC BY-NC-SA 4.0 por Laboratorios Narratech.