Olmo‑core 3 supera a Megatron‑Core en entrenamiento de MoE con 2,7× más rendimiento

Hugging Face lanza Olmo‑core 3, una infraestructura de entrenamiento de modelos mixtos de expertos que permite escalar a más de un billón de parámetros manteniendo la eficiencia y reduciendo costos.
Hugging Face anunció hoy la disponibilidad de Olmo‑core 3, la tercera generación de su framework para entrenar grandes modelos de lenguaje con arquitectura de mezcla de expertos (MoE). La novedad se centra en una re‑diseñada pila de entrenamiento que promete escalar los MoE al rango de trillones de parámetros sin perder la ventaja de eficiencia que caracteriza a este tipo de modelos.
Arquitectura y salto de escala
El punto crítico de los MoE es que, aunque el modelo completo puede contener cientos de miles de millones de parámetros, cada token sólo necesita consultar un subconjunto de expertos. Olmo‑core 3 amplía la piscina de expertos de 8 a 128, manteniendo la selección de cuatro expertos por token. Con esa configuración, el número de parámetros activos por token se mantiene alrededor de 3,2 mil millones, mientras que la capacidad total del modelo crece de 4,6 mil millones a 47 mil millones. En pruebas internas, la caída del rendimiento total fue inferior al 5 %, lo que demuestra que la arquitectura sigue siendo eficiente al multiplicar por diez la capacidad.
Olmo‑core 3 también ha sido validado en configuraciones que superan el un billón de parámetros, lo que lo sitúa entre los pocos sistemas capaces de manejar esa magnitud sin requerir hardware de gama extrema.
Rendimiento frente a Megatron‑Core
El principal competidor en el espacio de entrenamiento de MoE es Megatron‑Core de NVIDIA. En un benchmark preliminar con ocho GPU NVIDIA B300, Olmo‑core 3 procesó 52 000 tokens por segundo por GPU, frente a los 19 400 que lograba la versión anterior basada en FSDP. El aumento representa una mejora de 2,7× en el rendimiento. La tabla siguiente resume los datos clave:
| Implementación | Tokens/s por GPU | Factor de rendimiento | Memoria activa |
|---|---|---|---|
Olmo‑core 3 (DDP) | 52 000 | 2,7× | ‑ |
Versión anterior (FSDP) | 19 400 | 1× | ‑ |
El salto se debe principalmente a la sustitución de FSDP por DDP, que mantiene los expertos residentes en la GPU y envía los datos relevantes sin necesidad de reunir y volver a repartir los pesos del modelo en cada mini‑batch.
Optimizaciones de enrutamiento y precisión MXFP8
Olmo‑core 3 incorpora tres técnicas clave para reducir la sobrecarga de comunicación:
- Paralelismo experto fila‑por‑fila: los datos dirigidos a cada experto se depositan directamente en los buffers de entrada, evitando pasos intermedios de reorganización.
- Enrutamiento residente en GPU: la metadata de enrutamiento se mantiene en la tarjeta, de modo que la CPU solo encola trabajo sin esperar transferencias.
- GEMM agrupado: combina múltiples operaciones pequeñas de los expertos en una única llamada de multiplicación de matrices, aprovechando mejor los núcleos de la GPU.
Además, el stack soporta MXFP8, un formato numérico de precisión reducida que representa ciertos valores con menos bits. En pruebas con cuatro GPUs B300, activar MXFP8 aumentó el rendimiento total en un 21 % respecto a BF16 y redujo la memoria pico de 103 GiB a 95 GiB. La mayor parte del beneficio provino de la fase de feed‑forward y del movimiento de datos entre expertos, más que de la capa de atención.
Estas mejoras no son independientes; acelerar una fase puede generar cuellos de botella en otra. Olmo‑core 3 está construido para equilibrar esos trade‑offs, ofreciendo a los investigadores la posibilidad de ajustar cada componente según sus recursos.
Qué implica para la investigación y la industria
El anuncio llega en un momento en que el coste computacional de los modelos de gran escala se ha convertido en una barrera de entrada para laboratorios académicos y startups. Al reducir la necesidad de replicar todo el modelo en cada GPU y al mejorar la eficiencia de la comunicación, Olmo‑core 3 abre la puerta a experimentos con trillones de parámetros en clusters modestos.
Para los grandes proveedores de IA, la herramienta representa una amenaza competitiva: si los investigadores pueden entrenar MoE de gran escala sin depender de infraestructuras propietarias como Megatron‑Core, la diferenciación basada en hardware se debilita. Al mismo tiempo, Hugging Face refuerza su posición como proveedor de infraestructuras abiertas, lo que podría acelerar la adopción de MoE en la comunidad de código abierto.
En la práctica, los equipos que ya utilizan PyTorch y Accelerate podrán integrar Olmo‑core 3 con cambios mínimos, gracias a la compatibilidad con DDP. Los usuarios deberán ajustar la configuración de expertos y evaluar si el formato MXFP8 aporta beneficios en sus flujos de trabajo específicos.
Olmo‑core 3 no es sólo una iteración menor; es una respuesta directa a los cuellos de botella de comunicación que limitan la escalabilidad de los MoE. Si la comunidad aprovecha sus ventajas, podríamos ver una nueva ola de modelos extremadamente grandes pero económicamente accesibles, lo que cambiará la dinámica de innovación entre gigantes de la nube y laboratorios independientes.
