La mayor liberación de IA en código abierto desafía a los gigantes

El Instituto de Modelos Fundacionales presenta K2 Horizon, una familia de seis modelos que hace público todo su código, registros y 20 billones de tokens de entrenamiento bajo licencia Apache 2.0.
La inmensa mayoría de los lanzamientos de inteligencia artificial calificados como ‘código abierto’ en la actualidad comparten un déficit común: publican únicamente los pesos del modelo compilado y una tabla de evaluaciones comparativas, manteniendo bajo secreto la receta exacta de su creación. El Instituto de Modelos Fundacionales (IFM) —un centro de investigación pionero creado en mayo de 2025 por la Universidad de Inteligencia Artificial Mohamed bin Zayed (MBZUAI)— acaba de alterar radicalmente esta dinámica con la presentación de K2 Horizon, una flota de seis modelos de lenguaje que abarcan desde los 900 millones hasta los 375.000 millones de parámetros.
A diferencia de competidores que imponen restricciones de uso comercial o mantienen ocultos sus datos de entrenamiento, el equipo del IFM ha entregado la totalidad del proceso de desarrollo. Esto incluye el código de entrenamiento, los archivos de configuración, los registros de ejecución detallados, los puntos de control intermedios y el corpus de entrenamiento de 20 billones de tokens. La iniciativa ha sido documentada a detalle tras su lanzamiento oficial, como fue reportado por MarkTechPost, marcando la liberación totalmente abierta de mayor escala registrada hasta la fecha.
Transparencia absoluta en un ecosistema de cajas negras
La propuesta de K2 Horizon se estructura en torno a la consistencia técnica a diferentes escalas. La familia consta de seis variantes específicas: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B y 0.9B. Todos los modelos comparten la misma arquitectura base, metodología de entrenamiento, vocabulario e interfaces de despliegue, con la única excepción del modelo más pequeño de 0.9B, que utiliza un vocabulario optimizado para reducir la carga de memoria. Esta homogeneidad permite a los desarrolladores crear prototipos ligeros en modelos de 3,7 mil millones de parámetros y escalar a la versión de 375 mil millones sin alterar la pila de infraestructura de procesamiento.
En lo relativo a la disponibilidad práctica, los modelos se encuentran accesibles a través de plataformas como Hugging Face bajo la permisiva licencia Apache 2.0. Las versiones incluyen optimizaciones FP8 y construcciones en formato GGUF, garantizando compatibilidad desde el primer día con motores de inferencia populares como vLLM, SGLang y Ollama sobre hardware de NVIDIA, AMD y Cerebras.
Arquitectura MoVA: cuando la dispersión llega a la atención
El aspecto técnico más relevante de K2 Horizon reside en su innovación arquitectónica. Los sistemas tradicionales basados en la arquitectura de Mezcla de Expertos (MoE, por sus siglas en inglés) —como los vistos en Mixtral o en variantes recientes de DeepSeek— aplican el enrutamiento disperso únicamente a las capas de red neuronal de transmisión directa (feed-forward). Sin embargo, los científicos de datos del IFM han diseñado la Atención de Mezcla de Valores (MoVA), un sistema que extiende la selección dinámica de expertos al propio mecanismo de atención multicabezal.
Esta innovación abre un segundo eje para escalar la capacidad del modelo sin multiplicar exponencialmente la carga computacional por cada elemento procesado. MoVA mantiene la compatibilidad con tecnologías estándar del sector como FlashAttention y la atención con consultas agrupadas. El modelo representativo de este enfoque, el K2-Horizon-MoVA-36B-A4B, cuenta con 36.000 millones de parámetros totales pero solo activa aproximadamente 4.000 millones por token. En las pruebas de rendimiento estandarizadas, este modelo logró 58,6 puntos en la prueba de entorno de terminal Terminal-Bench 2.1 y 26,8 en tau3-Banking, superando a sus competidores directos de tamaño equivalente.
Uno: aceleración del triple de velocidad mediante difusión
Junto a las arquitecturas base, los investigadores presentaron Uno, un método de decodificación paralela que resuelve uno de los cuellos de botella históricos del procesamiento autoregresivo: la generación de texto token por token. Al congelar los parámetros autoregresivos del modelo principal y entrenar un conjunto ligero de parámetros mediante destilación de difusión, los adaptadores Uno son capaces de generar bloques enteros de texto en paralelo.
Esta técnica, entregada en forma de adaptadores de bajo rango (LoRA), permite multiplicar la velocidad de inferencia por tres sin registrar degradación en la calidad de las respuestas. Actualmente se encuentra desplegada en las versiones de 7B y 0.9B. La ingesta de datos del proyecto se sustentó en un volumen de 20 billones de tokens, de los cuales cerca del 17% correspondió a trayectorias explícitas de resolución de problemas con razonamiento detallado. Además, el equipo integró definiciones de herramientas en formatos JSON, XML y Markdown durante la fase de entrenamiento, concluyendo que el uso prioritario de Markdown durante la inferencia mejora la eficiencia sintáctica en un 18,5% en comparación con el formato JSON tradicional.
En el extremo superior de rendimiento, la variante más masiva (K2-Horizon-375B-A23B) registró una puntuación de 70,2 en Terminal-Bench 2.1 y un índice Elo de 1.441 en las evaluaciones de capacidad analítica de GDPVal-AA, posicionándose como una de las alternativas abiertas más sólidas del mercado actual.
💡 El panorama general: ¿Cómo nos afecta esto?
El movimiento estratégico del Instituto de Modelos Fundacionales redefine el listón de lo que la comunidad tecnológica debe exigir bajo el término ‘código abierto’. Durante los últimos dos años, el mercado ha presenciado una marea de modelos calificados como abiertos que en realidad funcionaban como productos semi-propietarios: sin acceso a los datos de entrenamiento origianles ni a los registros de errores, la investigación independiente quedaba seriamente limitada para auditar sesgos, mitigar vulnerabilidades de seguridad o replicar los hallazgos científicos.
Al entregar la auditoría completa del proceso —desde el código fuente hasta la mezcla exacta de 20 billones de tokens—, K2 Horizon proporciona a empresas, gobiernos e instituciones científicas la capacidad real de adaptar modelos de lenguaje de gran escala en su propia infraestructura sin depender de la opacidad de los grandes proveedores en la nube. Esta autonomía es vital para sectores regulados como la salud, la banca o la defensa, donde la trazabilidad del código y la soberanía de los datos son requisitos innegociables.
En el plano económico, la combinación de arquitecturas dispersas avanzadas como MoVA y adaptadores de velocidad como Uno acelera la viabilidad financiera del despliegue local. La posibilidad de ejecutar agentes de razonamiento eficientes en servidores modestos o incluso en ordenadores portátiles reduce los costes operativos de la inferencia en un momento en que el consumo energético y la escasez de chips de procesamiento gráfico amenazan con encarecer el acceso a la inteligencia artificial avanzada.
