JetBrains supera a Qwen3.5 con Mellum2.1, el modelo de 12 B que solo activa 2,5 B por token

JetBrains ha puesto a disposición Mellum2.1, un modelo de 12 B con arquitectura Mixture‑of‑Experts que solo emplea 2,5 B de parámetros por token, prometiendo velocidad y coste reducidos para agentes de programación.
JetBrains ha lanzado Mellum2.1, una versión mejorada de su modelo de razonamiento para agentes de código. Con 12 B de parámetros totales y una arquitectura Mixture‑of‑Experts (MoE) que activa únicamente 2,5 B por token, el modelo se posiciona como una alternativa de alto rendimiento y bajo consumo frente a los gigantes cerrados que dominan el mercado de asistentes de programación.
Arquitectura MoE y estrategia de activación
El núcleo de Mellum2.1 sigue la misma estructura de 28 capas y 64 expertos. Un router inteligente elige 8 expertos por token, lo que permite que la carga computacional se mantenga en torno a los 2,5 B parámetros activos. La atención se implementa mediante grouped‑query attention con 32 cabezas de consulta y 4 cabezas KV, y tres de cada cuatro capas emplean una ventana deslizante de 1 024 tokens. El contexto máximo alcanza los 131 072 tokens, una cifra que supera con creces a la mayoría de los modelos de código abierto actuales.
Entrenamiento orientado a agentes de software
La mayor novedad no está en la arquitectura, sino en el proceso de entrenamiento. JetBrains trasladó el aprendizaje por refuerzo (RL) del último tramo a la fase principal del entrenamiento, incorporando tareas de matemáticas, programación competitiva, ciencia y, sobre todo, ingeniería de software. El modelo se expone a millones de sandbox con repositorios reales, ejecuta comandos de shell, edita archivos y recibe recompensas cuando los tests pasan. Este enfoque «in‑the‑wild» permite que Mellum2.1 genere cadenas de pensamiento antes de responder, facilitando la depuración y la trazabilidad de sus decisiones.
Rendimiento frente a la competencia
Según los benchmarks publicados por JetBrains, Mellum2.1 supera a su predecesor en 15 de 17 pruebas y gana en 5 de 17 frente a Qwen3.5‑9B, otro modelo de código abierto. Los resultados más destacados son:
- LiveCodeBench v6: 82,0 puntos, por delante de Qwen3.5‑9B (75,4) y Gemma 4 E4B (69,4).
- HumanEval+: 91,5 puntos.
- MBPP+: 79,4 puntos.
- SWE‑bench Verified: 47,0 puntos (subida dramática desde 2,0 en Mellum2).
En pruebas de tareas más exigentes, como Terminal‑Bench 2.1, el modelo todavía queda por detrás de Qwen3.5‑9B (17,4 vs 21,7). La brecha se explica por la menor cobertura de conocimientos generales y por la limitada exposición a entornos de terminal complejos durante el entrenamiento.
Implicaciones prácticas para desarrolladores independientes
El modelo está disponible bajo licencia Apache 2.0 en Hugging Face y puede ejecutarse en una única GPU Nvidia H200 mediante vLLM o SGLang. Las versiones GGUF para llama.cpp, Ollama y LM Studio ocupan apenas 7 GB, lo que permite su despliegue en laptops con 12 GB de VRAM. Para un desarrollador que antes necesitaba alquilar instancias en la nube, la posibilidad de auto‑hostear un agente de código que explore repositorios, genere parches y valide cambios representa un ahorro considerable.
Sin embargo, la promesa de “auto‑hosted” viene con una carga operativa: configurar los sandbox, gestionar los tokens de acceso a repositorios privados y monitorizar los procesos de RL en tiempo real no es trivial. JetBrains ofrece documentación, pero la curva de adopción sigue siendo alta para equipos sin experiencia en despliegues de modelos MoE.
¿Innovación real o estrategia de marketing?
El anuncio de Mellum2.1 combina elementos genuinos de avance técnico con una dosis de hype. Por un lado, la arquitectura MoE activada de forma selectiva y el entrenamiento en entornos reales son pasos concretos hacia modelos de agente más eficientes. Por otro, la mayor parte de los números provienen de pruebas internas; la comunidad ha señalado que los benchmarks de código abierto suelen favorecer configuraciones altamente optimizadas que no se traducen directamente a casos de uso cotidianos.
Quien gana es claramente JetBrains: refuerza su posición en el ecosistema de herramientas de desarrollo y crea una puerta de entrada para su suite de productos de IA. Los desarrolladores independientes ganan una alternativa libre de costos de API, aunque deben asumir la complejidad de la infraestructura. Los gigantes cerrados —OpenAI, Anthropic— siguen manteniendo la delantera en tareas de razonamiento general y en la disponibilidad de servicios gestionados, lo que les permite seguir cobrando por consumo.
En última instancia, Mellum2.1 demuestra que la innovación en IA de código abierto está alcanzando niveles de rendimiento antes reservados a modelos propietarios, pero el ecosistema todavía necesita madurar en torno a la facilidad de uso y la robustez en entornos productivos.
Perspectiva a medio plazo
Si la tendencia de entrenar modelos directamente en repositorios de código continúa, veremos agentes cada vez más autónomos, capaces de gestionar ciclos completos de desarrollo sin intervención humana. La presión sobre los proveedores de nube para reducir precios y ofrecer GPUs más accesibles se intensificará, mientras que la comunidad open source seguirá empujando límites de eficiencia mediante arquitecturas MoE. Mellum2.1 es, en ese sentido, una señal de que la carrera ya no es solo de tamaño de modelo, sino de cómo se aprovechan los recursos para tareas específicas.
