La ilusión de la IA omnimodal al descubierto por una nueva prueba

Las promesas de los gigantes tecnológicos sobre modelos capaces de dominar texto, audio y vídeo simultáneamente se enfrentan a la realidad: la mayoría fracasa al intentar procesar más de dos formatos a la vez.
Menos del 35% de éxito. Ése es el paupérrimo rendimiento real que alcanzan los sistemas de inteligencia artificial más avanzados del mercado cuando se les exige operar fuera de su zona de confort. Mientras las grandes corporaciones invierten miles de millones de dólares en convencer al público de que sus modelos son sistemas «omnimodales» capaces de ver, escuchar, redactar y razonar de forma fluida, una evaluación independiente ha alzado la voz para señalar que el traje del emperador está repleto de costuras abiertas.
El espejismo del marketing en los sistemas todoterreno
Durante el último año, la narrativa dominante en el sector de la inteligencia artificial dio un giro radical. Ya no bastaba con ser un modelo de lenguaje brillante en texto; el verdadero trofeo residía en la capacidad omnimodal. Las demos promocionales prometían asistentes capaces de analizar un vídeo en directo, interpretar un documento complejo, escuchar instrucciones de viva voz y responder alternando imágenes y voz sintética en tiempo real.
Sin embargo, un riguroso examen desarrollado por un grupo de investigadores independientes y hecho público en una reciente investigación de referencia revela que la brecha entre los vídeos de demostración y la realidad técnica es abismal. La razón principal de este engaño estadístico reside en cómo se medía la IA hasta ahora: la inmensa mayoría de las pruebas de la industria evalúan únicamente capacidades bimodales, es decir, texto combinado con una sola modalidad adicional (texto e imagen, o texto y audio). Al aislar las funciones, los modelos parecen rozar la perfección.
Pruebas cruzadas: la prueba de fuego que desarmó a los gigantes
Para exponer las vergüenzas del sector, los expertos diseñaron el Índice de Madurez de Modalidad (MMI, por sus siglas en inglés), un marco de evaluación compuesto por casi 900 preguntas complejas que fuerzan a la tecnología a procesar e interconectar hasta cinco formatos distintos: texto, imágenes, audio, vídeo y documentos.
Los resultados de aplicar este baremo a cinco de los modelos más avanzados de la industria resultan demoledores para el relato comercial. El indicador de presencia de modalidad —que mide sencillamente si la máquina es capaz de responder en los formatos solicitados— registró cifras sonrojantes: sistemas como Claude Opus 4.6 apenas alcanzaron un 15,6% de efectividad, mientras que el modelo de mayor puntuación, GPT-5.4, se quedó en un modesto 34,9%. Esto significa que, en la mayoría de los casos, la IA simplemente ignora las instrucciones de formato o colapsa en el intento de generar la respuesta requerida.
El problema de fondo: la máquina ni siquiera entiende el formato
Lo preocupante de este análisis no es solo que la inteligencia artificial entregue respuestas incorrectas, sino que ni siquiera es capaz de estructurar el formato de salida adecuado. Si a un sistema se le pide un informe visual respaldado por una explicación en audio y un esquema en documento a partir de un vídeo de origen, la arquitectura actual se fragmenta.
Los analistas del sector apuntan a un patrón claro: las empresas han priorizado el empaquetado comercial por encima de la integración profunda de la arquitectura interna de la IA. Crear un sistema genuinamente omnimodal requiere procesar distintos tipos de datos en un espacio vectorial unificado, un desafío ingenieril astronómico que las empresas están atajando con parches de software y modelos secundarios interconectados de forma deficiente.
- Falsas expectativas: Las pruebas tradicionales solo evalúan dos modalidades simultáneas, ocultando los fallos en escenarios reales.
- Tasa de error crítica: Los modelos más potentes fallan en más del 65% de las tareas cuando se cruzan tres o más formatos.
- Incapacidad de salida: En la mayoría de los fallos, el modelo ni siquiera genera el archivo de audio o vídeo solicitado.
💡 El panorama general: ¿Cómo nos afecta esto?
Este hallazgo pone de manifiesto una peligrosa desconexión entre las expectativas de automatización que se están vendiendo a las empresas y las capacidades reales de la tecnología. Muchas compañías están reestructurando flujos de trabajo e invirtiendo en integraciones de IA bajo la premisa de que estos sistemas pueden sustituir procesos complejos de análisis multicanal, cuando la realidad muestra que la tecnología aún no está madura para gestionar tareas de alta complejidad sin supervisión humana constante.
Desde una perspectiva económica y ética, el informe cuestiona la transparencia con la que las grandes tecnológicas comunican los límites de sus productos. Comercializar herramientas como «sistemas universales» cuando fallan en dos de cada tres interacciones multinivel genera un riesgo operativo directo para sectores críticos como la medicina, la educación o el análisis legal, donde la pérdida de información entre formatos puede tener consecuencias graves.
A corto plazo, es probable que este baño de realidad obligue a la industria a frenar la carrera de anuncios espectaculares y concentrarse en la consolidación arquitectónica. La verdadera revolución de la inteligencia artificial no llegará por acumular modalidades de forma superficial en una interfaz, sino por lograr que los modelos comprendan el mundo digital con la misma coherencia transversal con la que lo hace la mente humana.
