La IA que analiza texto e imagen juntas sin consumir apenas memoria

Un nuevo modelo de código abierto elimina los componentes redundantes de las arquitecturas tradicionales para comprender y recuperar documentos visuales a velocidad récord.
¿Alguna vez has intentado buscar un dato específico dentro de un documento PDF de cien páginas repleto de gráficos, tablas y texto escaneado? Para un ser humano puede ser una tarea exasperante, pero para los sistemas tradicionales de inteligencia artificial tampoco resultaba un paseo por el campo. Hasta ahora, cuando un ordenador intentaba entender una página web o un informe técnico, necesitaba recurrir a una suerte de ‘frankenstein digital’: combinaba un modelo especializado en ver imágenes con otro modelo diferente especializado en entender texto. ¿El resultado? Un sistema pesado, lento y que consumía ingentes cantidades de energía.
Para solucionar esta ineficiencia, el equipo de desarrolladores de H Company acaba de presentar NeoMME, una familia de modelos de inteligencia artificial extremadamente ligeros —de solo 260 y 800 millones de parámetros— capaces de procesar palabras e ilustraciones en un único e integrado ‘cerebro’ digital. Esta arquitectura no solo simplifica el proceso, sino que demuestra que no siempre se necesita más potencia bruta para lograr mejores resultados, según se explica en un análisis detallado sobre NeoMME publicado en MarkTechPost.
Un solo cerebro para ver y leer al mismo tiempo
Imagina que para conducir un coche necesitaras a dos personas en el asiento del piloto: una que mira fijamente a la carretera y le grita lo que ve a otra que sostiene el volante sin poder abrir los ojos. Ridículo, ¿verdad? Eso es exactamente lo que hacían los buscadores de documentos visuales hasta la fecha. Reutilizaban grandes modelos de lenguaje generativo pegándoles una ‘torre de visión’ externa. Esto significaba arrastrar componentes gigantescos que realizaban cálculos innecesarios para tareas que solo requerían analizar información.
NeoMME cambia las reglas del juego al emplear una arquitectura de torre única (single-tower). En lugar de dividir el trabajo, una única red neuronal toma los fragmentos de texto en varios idiomas y los pequeños mosaicos de imagen de 32×32 píxeles y los procesa simultáneamente desde el primer segundo. Es como si el sistema hubiera nacido siendo bilingüe en texto y visión, sin necesidad de traductores intermedios.
Esta integración directa permite al modelo gestionar textos complejos e imágenes en resolución 4K dentro de una memoria contextual de 16.384 tokens. En términos sencillos: puede ‘mirar’ dos páginas completas en altísima resolución a la vez, examinando el diseño, los diagramas y los párrafos sin perder un solo detalle del contexto general.
Rendimiento de infarto en ordenadores convencionales
Lo más fascinante de esta nueva familia de modelos no es solo su diseño conceptual, sino su asombrosa eficiencia práctica en entornos reales. Al eliminar el peso muerto de los componentes tradicionales, la versión más pequeña de NeoMME (260 millones de parámetros) logra hitos de velocidad que eran impensables hace poco tiempo:
- Velocidad de indexación: Es capaz de procesar e indexar más de 51 páginas por segundo utilizando una sola tarjeta gráfica industrial.
- Búsquedas instantáneas: Puede responder a una consulta de búsqueda en solo 78,3 milisegundos funcionando únicamente en el procesador principal (CPU) de un ordenador normal, sin requerir potentes tarjetas gráficas.
- Compresión del lenguaje: Su nuevo analizador de texto comprende 14 idiomas emitiendo un 44,4% menos de datos redundantes que otros modelos de referencia como ModernBERT.
- Licencia totalmente abierta: Se ha publicado bajo la licencia Apache 2.0, lo que permite a cualquier empresa o desarrollador integrarlo libremente en sus aplicaciones a través de la plataforma Hugging Face.
El truco del rompecabezas incompleto
¿Cómo se consigue que un modelo tan pequeño aprenda a relacionar texto e imagen con tanta precisión? Los científicos detrás del proyecto recurrieron a un método de entrenamiento muy ingenioso basado en la difusión enmascarada. Visualízalo como un juego en el que le enseñas a la IA la foto de un documento donde se han tapado con tinta negra muchas palabras y fragmentos visuales.
En el entrenamiento de NeoMME, el sistema se ve obligado a adivinar las partes ocultas. A veces se le oculta hasta el 90% del texto de una página, obligándolo a mirar las imágenes y tablas visibles para poder deduciendo qué ponía en las zonas tapadas. Los experimentos demostraron que cuando el modelo miraba los fragmentos visuales, su precisión para adivinar el texto oculto aumentaba en casi un 40%. Este entrenamiento intensivo fuerza al sistema a ‘leer’ la página como lo haría un humano: utilizando las imágenes para entender el texto y el texto para interpretar los gráficos.
💡 El panorama general: ¿Cómo nos afecta esto?
La llegada de arquitecturas como NeoMME marca un cambio de rumbo fundamental en la industria de la inteligencia artificial. Durante los últimos tres años, la tendencia imperante ha sido crear modelos cada vez más gigantescos y voraces en consumo energético. Sin embargo, este enfoque está empezando a chocar contra muros económicos y ecológicos. Demostrar que un modelo de apenas 260 millones de parámetros puede superar a gigantes hipertrofiados en tareas específicas es una excelente noticia para la democratización tecnológica.
Para las empresas y administraciones públicas, esto significa que pronto podrán implementar buscadores ultrarrápidos sobre sus archivos digitalizados (contratos, expedientes médicos, planos arquitectónicos) directamente en servidores locales sin gastar fortunas en infraestructura en la nube. Además, el hecho de que la consulta pueda procesarse en milisegundos usando un procesador convencional abre la puerta a que estos buscadores funcionen sin conexión a internet directamente en nuestros portátiles o teléfonos móviles.
En última instancia, NeoMME nos recuerda que en el diseño de software la elegancia prima sobre la fuerza bruta. Rediseñar los cimientos desde cero suele ser más difícil que pegar parches sobre tecnologías existentes, pero cuando se hace bien, los beneficios en velocidad, costes y accesibilidad terminan impactando en el día a día de millones de usuarios.
