Tencent divide su nueva IA entre cerebro y cerebelo para hablar mientras trabaja

Investigadores del gigante chino presentan Gander, una arquitectura capaz de mantener una conversación fluida en tiempo real sin pausar la ejecución de tareas complejas en segundo plano.
Hasta hoy, los asistentes de voz basados en inteligencia artificial funcionaban de forma parecida a un walkie-talkie: escuchan, procesan en silencio y responden, congelando cualquier otra labor mientras dura la conversación. El equipo de voz de Tencent Hunyuan, en colaboración con varias universidades, busca erradicar esta limitación mediante Gander, un modelo de investigación diseñado para charlar de forma ininterrumpida mientras ejecuta labores pesadas como programar o analizar documentos.
La arquitectura en dos niveles que combina habla y razonamiento
Imagina que conduces un vehículo por una ruta conocida mientras mantienes una charla amena con un copiloto. Tu cerebro no necesita empeñar toda su capacidad cognitiva en mover el volante; esa tarea automatizada recae en estructuras motoras secundarias, liberando a la corteza cerebral para seguir la conversación. Los ingenieros de Tencent han aplicado exactamente la misma lógica biológica al diseño de Gander, dividiendo su arquitectura en dos componentes especializados: un cerebelo y un cerebro.
El cerebelo se encarga de la interacción directa y continua en tiempo real. Procesa streams de audio, texto e imagen en pequeños bloques de apenas un segundo de duración. Con este ritmo, el modelo es capaz de detectar si el usuario lo ha interrumpido, si debe formular una pregunta de aclaración o si le corresponde guardar silencio mientras la otra persona habla. Todo esto ocurre sin recurrir a módulos externos de detección de actividad vocal (VAD), apoyándose únicamente en los últimos dos minutos de historial conversacional que conserva en memoria inmediata.
Por su parte, el cerebro trabaja en segundo plano desvinculado del tiempo de respuesta del micrófono. Su misión es razonar, planificar y ejecutar código o búsquedas complejas. La gran ventaja técnica de esta separación es que el módulo cerebral es completamente intercambiable. Durante las pruebas de laboratorio, los investigadores conectaron sistemas de agentes externos como Claude Code y modelos pertenecientes a la familia GPT-4o de OpenAI. Si el motor de razonamiento del fondo mejora, la fluidez conversacional de la fachada no se ve alterada en absoluto.
La balanza entre velocidad conversacional y precisión técnica
La fluidez al hablar exige latencias mínimas, mientras que la resolución de un problema lógico requiere tiempo de cómputo. Al medir el desempeño de Gander en el benchmark especializado Full-Duplex-Bench v3 —diseñado para evaluar asistentes de voz en interacción bidireccional—, el sistema de Tencent logró la puntuación más alta en sincronización temporal entre todos los modelos analizados.
| Modelo evaluado | Precisión de inicio de respuesta | Tasa de interrupciones no deseadas |
|---|---|---|
| Tencent Gander | 100% de los escenarios | 8,0% |
| GPT-Realtime | Variable según latencia | 13,5% |
| Competidor de menor rendimiento | Inconsistente | 47,8% |
Sin embargo, la arquitectura no está exenta de peajes técnicos. La evaluación de Tencent revela que Gander experimenta una ligera degradación en la precisión de las tareas finales. Al estar entrenado con un corpus de 2,7 millones de ejemplos optimizado primordialmente para la naturalidad del diálogo, el sistema pierde cierta agudeza en la percepción visual y espacial detallada, fallando con mayor frecuencia al contar objetos o situarlos dentro de una imagen compleja en comparación con el modelo base sin capa conversacional.
El reto técnico de eliminar la latencia sin perder agudeza mental
El desarrollo de asistentes capaces de gestionar flujos de trabajo en segundo plano no es un capricho estético, sino una necesidad operativa para la industria. Estudios de interacción en herramientas avanzadas como Claude Code muestran que los desarrolladores experimentados interrumpen al agente en cerca del 9% de los pasos de trabajo, buscando corregir el rumbo antes de que el modelo consuma tokens de cómputo innecesarios.
Tencent ha confirmado su intención de publicar el código, los pesos del modelo y el conjunto de datos de entrenamiento en GitHub una vez concluyan los trámites internos de código abierto. Esta decisión posiciona a Gander como una pieza clave dentro de la estrategia de la compañía, que ya integra su modelo de lenguaje Hy3 en servicios masivos como WeChat y negocia participaciones mayoritarias en startups de agentes como Manus.
A nivel de infraestructura, la verdadera fricción que deberá resolver la comunidad abierta reside en la distribución de recursos de hardware. Ejecutar de forma simultánea un modelo de voz ligero para el cerebelo y un motor de razonamiento denso en la memoria VRAM exige optimizaciones severas en la gestión del caché de claves y valores (KV Cache) para evitar que las peticiones de audio interrumpan los ciclos de reloj asignados al pensamiento profundo.
