EmbeddingGemma 2 supera a Qwen3‑VL en multimodalidad con 740 M parámetros y licencia abierta

EmbeddingGemma 2 supera a Qwen3‑VL en multimodalidad con 740 M parámetros y licencia abierta

Google DeepMind puso a disposición EmbeddingGemma 2, un modelo abierto de 740 M parámetros que integra texto, código, imágenes, audio y vídeo en un único espacio de 768 dimensiones, pensado para búsquedas y clasificación en el dispositivo.

DeepMind anunció ayer la publicación de EmbeddingGemma 2, el sucesor de su modelo de embeddings multimodales. Con 740 M de parámetros, una ventana de contexto de 8 192 tokens y una licencia Apache 2.0, el modelo ya está disponible en Hugging Face, Kaggle, Ollama y en versiones optimizadas para llama.cpp y LiteRT. Su principal promesa es permitir búsquedas, clasificación y recuperación‑a‑generación (RAG) totalmente locales, reduciendo la latencia y evitando la exposición de datos a la nube.

Qué permite un modelo de embeddings multimodales

Un modelo de embeddings transforma cualquier tipo de contenido en un vector numérico que captura su significado semántico. Cuando los vectores de distintas piezas de información están cerca en el espacio, se vuelve trivial encontrarlos mediante búsquedas de similitud. En una cadena RAG, esos vectores sirven como puente entre un LLM y documentos externos, lo que permite que el modelo recupere información que no estaba presente en su entrenamiento.

La característica distintiva de EmbeddingGemma 2 es que todas esas modalidades –texto, código, imágenes, audio y vídeo– comparten el mismo espacio de 768 dimensiones. Un fragmento de código puede localizar una captura de pantalla; una nota de voz puede devolver un clip de vídeo relevante. Esa unificación reduce la complejidad de los pipelines y abre la puerta a aplicaciones que combinan varios tipos de datos sin necesidad de entrenar modelos separados.

Arquitectura modular y opciones de despliegue

El modelo se construye sobre la arquitectura Gemma 4 y está dividido en tres bloques que pueden cargarse de forma independiente:

  • Tronco de texto y código: 270 M de parámetros (130 M transformador + 140 M codificador).
  • Codificador visual: 170 M de parámetros, opcional.
  • Codificador de audio: 300 M de parámetros, opcional.

Esta modularidad permite a los desarrolladores escoger la combinación que mejor se ajuste a sus recursos: 270 M para solo texto, 440 M para texto + visión, 570 M para texto + audio o el conjunto completo de 740 M para todas las modalidades. Independientemente de la configuración, los vectores generados permanecen compatibles entre sí, de modo que una consulta embebida con la versión ligera puede comparar contra documentos creados con la versión completa.

En dispositivos de consumo, la cuantización a INT4 y INT8 reduce el uso de RAM a aproximadamente 191 MB para el modelo solo‑texto y a 567 MB para el modelo multimodal completo. En pruebas realizadas por el equipo Google AI Edge, la inferencia de una imagen en un MacBook M5 Pro GPU tomó 37,3 ms con un presupuesto de 70 tokens para visión.

Rendimiento y comparativas con la competencia

Según la hoja de modelo de DeepMind, EmbeddingGemma 2 lidera los benchmarks de la familia MTEB y MAEB entre los embedders multimodales de menos de mil millones de parámetros. Los resultados a 768 dimensiones son los siguientes:

Benchmark EmbeddingGemma 2 EmbeddingGemma 1
MTEB multilingual v2 61.36 61.15
MTEB Code v1 78.68 68.76
MIEB lite (image) 64.64 n/a
MMEB v2 overall 59.01 n/a
MSEB retrieval (sound) 69.54 n/a
MAEB (audio) 49.39 n/a

En la tarea de recuperación de código, el modelo gana 9.92 puntos frente a su predecesor, lo que equivale a una mejora del 14 %. En comparación, Qwen3‑VL‑Embedding‑2B alcanza 73.2 en MMEB‑V2, pero con casi tres veces más parámetros y sin soporte de audio.

El método Matryoshka Representation Learning (MRL) permite truncar los vectores a 512, 256 o 128 dimensiones, reduciendo el espacio de almacenamiento hasta 6 ×. La caída de rendimiento es moderada: pasar de 768 a 256 dimensiones reduce la puntuación MTEB multilingual de 61.36 a 60.41, mientras que a 128 dimensiones el MMEB desciende a 45.65.

Implicaciones para la privacidad y el edge computing

Al ejecutar los embeddings localmente, los datos nunca abandonan el dispositivo, lo que refuerza la privacidad en aplicaciones como asistentes personales, búsqueda de documentos confidenciales o sistemas de recomendación en entornos corporativos. Además, la huella de memoria y la latencia observada hacen viable el despliegue en smartphones de gama alta (Pixel 11 Pro) y laptops con GPU integrada.

Sin embargo, la apertura bajo Apache 2.0 también plantea preguntas sobre la sostenibilidad del proyecto. DeepMind no ha revelado los costos de entrenamiento ni los planes de mantenimiento a largo plazo. La comunidad tendrá que asumir gran parte del soporte, lo que podría fragmentar el ecosistema si surgen forks incompatibles.

Qué implica para desarrolladores independientes

Para los equipos que construyen productos de búsqueda o recomendación en el dispositivo, EmbeddingGemma 2 ofrece una solución llave‑en‑mano que elimina la necesidad de licencias propietarias y de infraestructura en la nube. La posibilidad de cargar solo los módulos necesarios reduce la barrera de entrada: un proyecto que solo requiere texto puede comenzar con menos de 200 MB de RAM.

El desafío práctico radica en la integración con pipelines existentes. Aunque los pesos están disponibles en formatos compatibles con gguf y LiteRT, la documentación todavía está en fase inicial y carece de ejemplos de producción a gran escala. Los desarrolladores deberán invertir tiempo en pruebas de cuantización y en la gestión de la compatibilidad entre versiones de torch, tensorflow y los runtimes de edge.

En suma, EmbeddingGemma 2 representa un paso significativo hacia modelos multimodales accesibles y respetuosos con la privacidad, pero su éxito dependerá de la capacidad de la comunidad para convertir esa promesa en implementaciones robustas y mantenibles.

Créditos y referenciasInformación basada originalmente en la cobertura de MarkTechPost y contrastada de forma independiente por el equipo de redacción de Data Mindset.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *