Supersonic Labs reta a gigantes con Julia 1, modelo de elección de 144M parámetros en CPU

Supersonic Labs, un laboratorio brasileño de IA, lanzó Julia 1, un modelo de decisiones de 144,3 M parámetros que se ejecuta sin necesidad de GPU, ofreciendo una alternativa ligera para tareas de clasificación y puntuación.
Supersonic Labs ha puesto en el mercado Julia 1, un modelo de decisiones que combina la eficiencia de un modelo de 144,3 millones de parámetros con la capacidad de ejecutarse en cualquier CPU moderna. A diferencia de los típicos grandes modelos de lenguaje, Julia 1 no genera texto, sino que recibe un contexto, una pregunta y entre 2 y 20 opciones candidatas, devuelve la opción elegida y la probabilidad asociada a cada una.
Julia 1 — qué es y cómo funciona
El modelo está pensado para tres tipos de decisiones a través de una única API:
- choice: selección de una etiqueta entre 2 y 20 opciones, útil para clasificación o enrutamiento.
- score: asignación de un índice esperado dentro de una escala ordenada (por ejemplo, bajo, medio, alto).
- noul: cálculo de la probabilidad de que una afirmación de sí‑o‑no sea verdadera.
Los resultados se devuelven en el mismo orden de las opciones enviadas, acompañados de un vector de probabilidades softmax y de cualquier identificador de llamada (por ejemplo, billing) que el cliente haya incluido. Al no generar texto, Julia 1 reduce significativamente la carga computacional y el riesgo de respuestas no deseadas.
Arquitectura y coste de entrenamiento
Julia 1 parte del encoder multilingüe mmBERT‑small, desarrollado por el Laboratorio de Ciencias de la Computación de la Universidad Johns Hopkins. Este encoder cuenta con 140 M de parámetros y está entrenado en más de 1.800 idiomas. Supersonic Labs mantuvo el encoder y el tokenizador, añadió una capa de decisión especializada y entrenó el conjunto con ejemplos estructurados en formato de decisión.
El proceso de entrenamiento se realizó en la nube con un gasto total de aproximadamente R$ 540 (US$ 104,08). Los pesos en precisión FP32 ocupan 550,5 MiB, lo que permite cargar el modelo en la memoria de una laptop típica sin necesidad de compresión adicional. La arquitectura soporta hasta 8 192 tokens combinados, aunque los benchmarks publicados usaron un límite de 1 024 tokens.
Supersonic Labs ya está trabajando en Julia 2, que empleará una arquitectura propia desarrollada internamente, pero aún no ha revelado detalles técnicos.
Rendimiento y comparativas
El 24 de septiembre de 2026 se ejecutó una evaluación en una GPU H200 con soporte BF16. Los resultados se compararon con el modelo Jev de TypeSafe, siguiendo el protocolo de referencia del benchmark Jev.
- Typed Decisions: 73,15 % (1 463/2 000) frente al 72,70 % de referencia.
- AG News (4 etiquetas): 94 % contra 91 % de referencia.
- DAIR Emotion (6 etiquetas): 86 % frente a 48 % de referencia.
- Banking77 (72 etiquetas): 64 % frente a 87 % de referencia, el único caso donde el modelo quedó por debajo del estándar.
- MASSIVE (18 escenarios, 52 locales): 71,50 % de precisión macro, con 86,25 % en portugués de Portugal y 86,75 % en inglés de EE. UU.
En una segunda corrida el 25 de septiembre, realizada en CPU, se obtuvieron 72,55 % en Typed Decisions y 60 % en Banking77, con tres abstenciones que redujeron ligeramente la puntuación.
Latencia en dispositivos locales
Supersonic Labs también publicó mediciones de latencia en diferentes hardware:
- Apple M4: 33,15 ms de mediana por decisión.
- Tablet Samsung SM‑X510 (ejecución vía ONNX Runtime): 203 ms de mediana, con un pico de 393,1 MiB de memoria residente.
- Intel Core i5‑1235U (laptop): 107,83 ms de mediana en la tarea AG News; la tarea Banking77 alcanzó 3 713,54 ms porque el modelo necesita evaluar 72 etiquetas antes de decidir.
En Twitter, el perfil oficial @supersonicai afirmó que Julia 1 clasifica 5 veces más rápido que Jev en un portátil i5. La comparación debe tomarse con cautela, pues el benchmark de Jev se realizó como un servicio alojado en Francia, lo que introduce latencias de red adicionales.
Qué implica Julia 1 para desarrolladores independientes
El hecho de que los pesos estén disponibles bajo licencia Apache 2.0 en Hugging Face permite descargarlos y ejecutarlos localmente con Python 3.11 o superior, sin necesidad de GPUs especiales. Además, Supersonic Labs ofrece una versión ONNX que funciona directamente en navegadores mediante WebGPU, lo que abre la puerta a aplicaciones web de decisión en tiempo real sin depender de servidores externos.
Para un desarrollador que necesita integrar una capa de clasificación o puntuación en una aplicación móvil, Julia 1 representa una solución práctica: el modelo cabe en menos de 600 MiB, se ejecuta en CPUs de gama media y su API sencilla (predict() o classify()) evita la complejidad de los pipelines de generación de texto. La única limitación actual es su desempeño en tareas con gran número de clases, como Banking77, donde la latencia se dispara.
En el futuro próximo, la comunidad podrá esperar una versión mejorada (Julia 2) con una arquitectura propia que podría reducir aún más los requerimientos de memoria y mejorar la precisión en dominios con muchas etiquetas. Mientras tanto, la disponibilidad inmediata de Julia 1 brinda a startups, investigadores y makers una herramienta lista para probar casos de uso de decisiones automatizadas sin incurrir en costos de infraestructura en la nube.
