Estudio de avatares conversacionales con IA: comparativa de LLM y Audio2Face

En el equipo de Research de Plain Concepts hemos estado trabajando durante varios meses para evaluar el rendimiento de un sistema de avatares conversacionales en tiempo real con el objetivo de identificar la configuración más adecuada para un entorno de producción. A lo largo de esta investigación analizamos distintos modelos de IA conversacional y configuraciones de hardware, evaluando métricas como la latencia, la estabilidad de las respuestas y el rendimiento del sistema completo. Los resultados nos han permitido identificar qué componentes tienen un mayor impacto en la experiencia del usuario y qué combinación ofrece el mejor equilibrio entre rendimiento y consistencia.

Avatar 3D conversacional en tiempo real renderizado con Evergine

Contexto y motivación

El objetivo de este proyecto es desarrollar un avatar conversacional capaz de mantener una interacción por voz con el usuario en tiempo real. El avatar escucha al usuario, interpreta su petición mediante un modelo de lenguaje y responde tanto con voz como con animaciones faciales sincronizadas, buscando ofrecer una conversación lo más natural posible. Para conseguirlo, hemos necesitado coordinar distintos componentes de procesamiento de voz, inteligencia artificial, animación facial y renderizado, minimizando la latencia total del sistema.

El pipeline que hemos utilizado durante las pruebas sigue la siguiente secuencia: el usuario habla y un sistema de Voice Activity Detection (VAD) detecta el final de su intervención. A continuación, el LLM (en este caso, Gemini 3.1 Live o un modelo de GPT Realtime) genera una respuesta en forma de audio. Estos fragmentos de audio se envían simultáneamente a NVIDIA Audio2Face, encargado de generar las animaciones faciales (blendshapes), y al servicio de reproducción de audio. Este último espera a disponer tanto del audio como de la animación correspondiente para reproducir ambos de forma sincronizada. Finalmente, el resultado se renderiza sobre el avatar mediante el motor gráfico Evergine.

Pipeline del avatar conversacional: entrada de micrófono del usuario, LLM (Google Live API o OpenAI GPT Realtime), fragmentos de audio, NVIDIA Audio2Face para los blendshapes, sincronización de audio y animación, y el avatar 3D renderizado en Evergine

Para que la interacción resulte natural, el tiempo total transcurrido desde que el usuario deja de hablar hasta que el avatar comienza a hablar y a animarse debe ser lo más reducido y predecible posible. De hecho, desde el punto de vista de la experiencia de usuario, los picos de latencia impredecibles resultan más perceptibles y molestos que una latencia ligeramente superior pero estable.

Parte I: Comparativa de proveedores LLM

Con el objetivo de identificar el proveedor más adecuado para un entorno de producción, hemos comparado el rendimiento de los principales modelos de lenguaje con capacidad de conversación en tiempo real. Nuestro interés no es únicamente conocer cuál respondía más rápido, sino también cuál ofrece una latencia más estable y predecible, un aspecto fundamental para que la interacción con el avatar resulte natural.

Para ello, medimos el TTFT (Time To First Token) de cada proveedor evaluado, es decir, el tiempo que transcurre desde que el VAD del cliente detecta el final de la intervención del usuario hasta que llega el primer byte de audio generado por el modelo. La metodología fue idéntica para todos los proveedores: mismo VAD, mismo valor de silence_duration_ms (200 ms) y el mismo banco de 20 preguntas organizadas por nivel de dificultad.

¿Qué es el TTFT y por qué importa?

TTFT significa “Time To First Token” o, en el contexto de audio, tiempo hasta el primer byte de audio. Es el intervalo que transcurre desde que el usuario deja de hablar hasta que llega el primer fragmento de respuesta sonora del modelo de lenguaje. No incluye Audio2Face ni el buffer de reproducción, es puro tiempo de “pensamiento” del LLM.

Cuanto menor sea el TTFT, antes puede empezar a procesarse el audio. Y cuanto más estable sea (menor desviación estándar), más predecible resulta la experiencia para el usuario.

Aunque otra métrica habitual en la evaluación de modelos es el TPOT (Time Per Output Token), en este estudio no se ha medido el TPOT porque, en este escenario, no aporta información relevante para la experiencia del usuario. Una vez recibido el primer fragmento de audio, el cuello de botella pasa a ser Audio2Face, que dispone de tiempo suficiente para procesar los siguientes fragmentos mientras estos continúan llegando. Por ello, el TTFT es la métrica que mejor representa la capacidad de respuesta percibida del sistema.

Metodología

Todos los proveedores se han medido en las mismas condiciones para que los resultados sean comparables:

Cada una de las 20 preguntas se ejecutó una única vez en cada proveedor, registrando el TTFT obtenido. Las métricas agregadas (media, desviación estándar, mínimo y máximo) se calcularon a partir del conjunto de las 20 mediciones por cada modelo.

La clasificación se realizó en función del esfuerzo de razonamiento esperado por parte del modelo. Las preguntas fáciles corresponden a saludos o conocimiento general sencillo; las medias requieren explicaciones breves; las complejas implican razonamiento o elaboración de recomendaciones; y las muy complejas exigen respuestas extensas con planificación, comparación o explicación detallada de conceptos.

El listado completo puede consultarse en el Anexo: Banco de preguntas utilizado.

Región de despliegue: GPT Realtime se sirve desde la región Azure Sweden Central. Gemini Live no expone región fija; Google enruta automáticamente las peticiones.

ProveedorMediaDesv. típicaMín.Máx.
Gemini 3.1 Live1.407 ms±118 ms1.191 ms1.626 ms
GPT-Realtime1.731 ms±399 ms834 ms2.783 ms
GPT-Realtime 1.51.869 ms±389 ms1.263 ms2.857 ms
GPT-Realtime-Mini1.758 ms±872 ms1.045 ms4.446 ms
GPT-Realtime-22.232 ms±126 ms1.931 ms2.523 ms

Gráfico de barras del TTFT medio por proveedor LLM; Gemini muestra la media más baja y la menor barra de error

Latencia por nivel de dificultad

El hallazgo más relevante es el comportamiento de cada modelo ante el incremento de complejidad. Gemini 3.1 Live mantiene una latencia prácticamente constante (~1.400 ms) independientemente de la dificultad. Los modelos GPT, en cambio, escalan significativamente: GPT-Realtime pasa de 1.201 ms en preguntas fáciles a 2.308 ms en preguntas muy complejas.

Nota: GPT-Realtime se desplegó en la región Azure Sweden Central, mientras que Gemini 3.1 Live utiliza el enrutado automático de la infraestructura de Google. En consecuencia, parte de las diferencias observadas en el TTFT podrían estar influenciadas por la latencia de red entre el cliente y la infraestructura de cada proveedor.

DificultadGemini 3.1 LiveGPT-RealtimeGPT-Realtime 1.5GPT-Realtime MiniGPT-Realtime 2
Fácil1.372 ms1.201 ms1.530 ms1.274 ms2.264 ms
Media1.389 ms1.554 ms1.674 ms1.385 ms2.314 ms
Compleja1.450 ms1.860 ms1.869 ms1.547 ms2.160 ms
Muy compleja1.416 ms2.308 ms2.401 ms2.825 ms2.192 ms

Gráfico de líneas de la latencia frente a la dificultad de la pregunta; Gemini se mantiene casi plano mientras los modelos GPT escalan con la complejidad

Hallazgos clave

Gemini es el más rápido y consistente. Con una media de 1.407 ms y una desviación estándar de solo ±118 ms, Gemini 3.1 Live es el proveedor más predecible. Responde siempre en el mismo rango, independientemente de lo que se le pregunte.

La latencia de Gemini NO escala con la complejidad. Pregunta fácil: 1.372 ms. Pregunta muy compleja: 1.416 ms. La diferencia es de apenas 44 ms, prácticamente ruido estadístico. Esto sugiere que el modelo de Gemini 3.1 Live está optimizado para latencia constante, no para dedicar más tiempo a razonar según la dificultad. Durante las pruebas no se apreciaron diferencias significativas en la calidad de las respuestas que justificasen esta latencia constante.

El hallazgo más interesante no es quién es más rápido, sino que Gemini tiene latencia constante sin importar la complejidad, mientras que GPT escala su tiempo de razonamiento con la dificultad.

GPT-Realtime es el más rápido en preguntas fáciles. En preguntas sencillas, GPT-Realtime llega a 1.201 ms, más rápido que Gemini. El problema llega con la complejidad: en preguntas muy complejas escala hasta 2.308 ms, casi el doble. Esto indica que dedica más tiempo de razonamiento cuanto más difícil es la pregunta.

GPT-Realtime-Mini tiene outliers severos. Dos preguntas muy complejas disparan su latencia a 4.446 ms y 3.781 ms. Con una desviación estándar de ±872 ms, es el más impredecible de todos, directamente no recomendable para producción con preguntas complejas.

Calidad de las respuestas. Más allá de la latencia, se observaron diferencias cualitativas entre modelos:

Estas observaciones son cualitativas, basadas en la experiencia durante las pruebas. No forman parte de un estudio de calidad sistemático, pero son relevantes para la decisión de producción.

Parte II: Comparativa de hardware para Audio2Face

Una vez que el LLM genera la respuesta en audio, ese audio debe convertirse en animaciones faciales: movimiento de labios, mejillas, cejas… Todo esto en tiempo real. NVIDIA Audio2Face (A2F) es el sistema que hace esa conversión, produciendo “blendshapes”, instrucciones numéricas que dictan exactamente cuánto se mueve cada músculo de la cara del avatar en cada instante.

Audio2Face es el componente más caro computacionalmente después del LLM. Puede ejecutarse de dos maneras:

¿Qué es un chunk de audio?

NVIDIA Audio2Face no procesa el audio completo de una sola vez, sino que lo recibe dividido en pequeños fragmentos (chunks) que se envían de forma continua a través de gRPC. Cada chunk contiene unos pocos cientos de milisegundos de audio y, en cuanto Audio2Face recibe uno de ellos, comienza a generar las animaciones faciales correspondientes sin esperar al resto de la frase.

El tamaño del chunk representa un compromiso entre latencia y eficiencia: chunks pequeños permiten iniciar antes la animación del avatar, pero incrementan el número de peticiones y el coste de procesamiento. Por el contrario, chunks más grandes reducen ese overhead, aunque obligan a esperar más tiempo antes de comenzar la animación.

Diagrama que explica un chunk de audio: la forma de onda completa de la frase "Hola, ¿cómo estás?" dividida en fragmentos de 500 ms enviados a lo largo del tiempo

Metodología

ChunkRTX 4070RTX 4080 SuperRTX 5090A100 (nube)4070→5090A100→5090
300 ms596 ms249 ms225 ms237 ms2,65×1,05×
500 ms637 ms325 ms283 ms303 ms2,25×1,07×
750 ms1.162 ms421 ms386 ms400 ms3,01×1,04×
1.000 ms1.240 ms495 ms455 ms476 ms2,73×1,05×
1.500 ms1.882 ms676 ms613 ms662 ms3,07×1,08×

Gráfico de la duración del chunk frente a la latencia de Audio2Face; la RTX 5090, la RTX 4080 Super y la A100 quedan agrupadas en valores bajos mientras la RTX 4070 escala con fuerza

La RTX 5090 obtiene la menor latencia en todos los tamaños de chunk. Sin embargo, la diferencia respecto a la RTX 4080 Super es relativamente pequeña (24–63 ms en las pruebas realizadas), por lo que el impacto sobre la latencia total del sistema es reducido. Esto indica que, desde el punto de vista de la latencia, ambas GPUs ofrecen un comportamiento muy similar.

En cuanto a la NVIDIA A100 desplegada en Azure Container Apps, su rendimiento es también muy próximo al de la RTX 5090, con una pequeña latencia adicional atribuible a la comunicación por red. Este tipo de despliegue constituye una alternativa para arquitecturas en las que Audio2Face se ejecuta de forma centralizada. No obstante, este estudio se limita al análisis de latencia y no evalúa aspectos como el coste de operación o el rendimiento bajo cargas concurrentes.

Parte III: Análisis de latencia combinada LLM + A2F

Combinando ambos estudios, la latencia total del pipeline (excluido el buffer de reproducción, constante en todas las configuraciones) es la suma del TTFT del LLM y la latencia de A2F.

La latencia de A2F se mide desde que se envía un chunk de audio por gRPC hasta que se reciben los blendshapes correspondientes a la animación del avatar. En los despliegues locales es procesamiento puro, mientras que en la A100 incluye el ida y vuelta por red.

Los valores de A2F corresponden a un chunk de 500 ms, que es el valor práctico de producción, ya que es un punto de equilibrio entre reducir la espera antes de iniciar la animación y mantener el overhead de peticiones gRPC en un nivel razonable.

LLMHardware A2FTTFT LLMA2F @500 msTotalDesv. típica
Gemini 3.1 LiveRTX 50901.407 ms283 ms1.690 ms±120 ms
Gemini 3.1 LiveA100 (nube)1.407 ms303 ms1.710 ms±119 ms
Gemini 3.1 LiveRTX 4080 Super1.407 ms325 ms1.732 ms±120 ms
Gemini 3.1 LiveRTX 40701.407 ms637 ms2.044 ms±122 ms
GPT-RealtimeRTX 50901.731 ms283 ms2.014 ms±401 ms
GPT-Realtime-2RTX 50902.176 ms283 ms2.459 ms±128 ms

Gráfico de barras horizontales de la latencia extremo a extremo para las combinaciones de LLM y GPU; las parejas con Gemini ocupan las posiciones más rápidas

La elección del proveedor LLM tiene mayor impacto que la del hardware: la diferencia entre el mejor y peor modelo (Gemini vs GPT-Realtime-2) es ~770 ms, frente a ~354 ms entre la mejor y peor GPU (RTX 5090 vs RTX 4070) a 500 ms de chunk. La consistencia es tan relevante como la velocidad absoluta: Gemini + RTX 5090 alcanza ±120 ms de desviación estándar combinada, frente a ±401 ms de GPT-Realtime + RTX 5090 y ±872 ms de GPT-Realtime-Mini.

Recomendaciones para producción

Tras evaluar las distintas combinaciones de modelos de IA conversacional y configuraciones de hardware bajo la arquitectura descrita en este estudio, es posible establecer una recomendación para su despliegue en un entorno de producción. La tabla siguiente resume las configuraciones más relevantes en función de la latencia total obtenida y la consistencia observada durante las pruebas. En las condiciones evaluadas, la combinación Gemini 3.1 Live + RTX 5090 obtuvo el mejor rendimiento global, ofreciendo la menor latencia y la mayor estabilidad del conjunto de configuraciones analizadas.

PrioridadLLMHardware A2FLatencia totalJustificación
🥇 ÓptimaGemini 3.1 LiveRTX 5090~1.690 msMenor latencia y mayor consistencia end-to-end
🥈 Mejor opción nubeGemini 3.1 LiveA100 (nube)~1.710 msSolo 20 ms adicionales; justificado para multiusuario
🥉 Sin RTX 5090Gemini 3.1 LiveRTX 4080 Super~1.732 msExcelente relación coste/rendimiento
⚠️ No recomendadoCualquieraRTX 4070>2.044 msNo ofrece latencia de animación aceptable en ninguna configuración de chunk
⚠️ No recomendadoGPT-RT-MiniCualquieraImpredecible±873 ms desv. típica; picos de hasta 4,4 s en preguntas muy complejas

Conclusiones

Este estudio analiza qué combinación de modelo de IA conversacional y hardware para Audio2Face ofrece la mejor experiencia en un avatar en tiempo real, medida principalmente a través de la latencia y su consistencia.

Entre los modelos evaluados, Gemini 3.1 Live es el más adecuado para producción: no solo es el más rápido en media, sino el más estable, respondiendo siempre en un rango muy similar independientemente de la complejidad de la pregunta. Los modelos GPT son competitivos en preguntas sencillas, pero su latencia crece con la dificultad y, en el caso de GPT-Realtime-Mini, llega a picos de más de 4 segundos que rompen completamente la naturalidad de la conversación.

En cuanto al hardware para la animación facial, con las gráficas que se han usado en este estudio, la RTX 5090 y la A100 en nube ofrecen un rendimiento muy similar. La RTX 4080 Super es una alternativa sólida con una diferencia inapreciable para el usuario. La RTX 4070, en cambio, introduce una latencia que compromete la fluidez en cualquier configuración, concluyendo que su uso no es recomendable para producción.

La combinación recomendada para producción es Gemini 3.1 Live con RTX 5090 o A100, con una latencia combinada de aproximadamente 1.700 ms y una variabilidad de ±120 ms, lo que garantiza una experiencia de conversación estable y natural.

Limitaciones del estudio

Los resultados y recomendaciones de este estudio deben interpretarse teniendo en cuenta las siguientes restricciones:

Anexo: Banco de preguntas utilizado

NivelPregunta
FácilHola, ¿cómo estás?
Fácil¿Qué hora es aproximadamente?
Fácil¿Cuál es la capital de Francia?
Fácil¿Cuántos días tiene una semana?
Fácil¿Qué color se obtiene al mezclar azul y amarillo?
MedioExplícame brevemente qué es la inteligencia artificial.
Medio¿Cuáles son las principales diferencias entre un perro y un gato como mascotas?
Medio¿Por qué el cielo se ve azul durante el día?
Medio¿Qué ventajas tiene hacer ejercicio de forma regular?
Medio¿Qué diferencias hay entre un SSD y un disco duro tradicional?
ComplejoEstoy aprendiendo programación. ¿Qué lenguaje me recomendarías para empezar y por qué?
ComplejoTengo un presupuesto de 1.500 € para comprar un ordenador para trabajar y jugar. ¿Cómo lo repartirías entre los distintos componentes?
ComplejoExplícame paso a paso cómo funciona una red neuronal de forma sencilla.
Complejo¿Qué ventajas y desventajas tiene trabajar de forma remota frente al trabajo presencial?
ComplejoSi quisiera aprender inglés desde cero en un año, ¿qué plan de estudio semanal me propondrías?
Muy complejoDiseña un plan detallado para organizar un viaje de 10 días por Japón con un presupuesto de 2.500 €, indicando qué ciudades visitar, transporte recomendado y distribución aproximada del presupuesto.
Muy complejoImagina que eres el responsable tecnológico de una empresa de 200 empleados que quiere migrar toda su infraestructura a la nube. Explica paso a paso cómo planificarías la migración minimizando riesgos y tiempos de inactividad.
Muy complejoCompara en profundidad los lenguajes C++, C# y Rust para el desarrollo de motores gráficos, analizando rendimiento, seguridad de memoria, facilidad de desarrollo y ecosistema. Finaliza con una recomendación razonada.
Muy complejoExplica cómo funciona un modelo de inteligencia artificial basado en transformadores desde que recibe una frase hasta que genera una respuesta, describiendo conceptos como tokenización, embeddings, mecanismo de atención e inferencia.
Muy complejoVoy a lavar mi coche en un lavadero que está a unos 20 metros de mi casa. ¿Crees que debería ir andando o en coche? Razona tu respuesta teniendo en cuenta que el objetivo es lavar el coche y que la distancia es muy corta.

Anexo: Entornos de prueba

ParámetroValor
Fecha de las medicionesJulio de 2026
Versión de Audio2Faceaudio2face-3d:2.0
Modelosgemini-3.1-flash-live-preview, gpt-realtime, gpt-realtime-mini, gpt-realtime-2, gpt-realtime-1.5
Equipo RTX 4070CPU: 13th Gen Intel(R) Core(TM) i7-13700H, RAM: 32 GB, OS: Windows
Equipo RTX 4080 SuperCPU: AMD Ryzen 7 7800X3D, RAM: 32 GB, OS: Windows
Equipo RTX 5090CPU: Intel Core i7-14700, RAM: 32 GB, OS: Windows
A100 (nube)Provider: Azure Container Apps, Region: Sweden Central
Author
Joan Manuel Ramos Refusta
Plain Concepts Research