Underdog lanza Saluki 27B y supera al Qwen3.8‑27B en llamadas a herramientas con solo 8 GB

Conway Research ha publicado Saluki 27B, una versión de 2 bits del modelo Qwen3.8‑27B que ocupa 7,89 GB y supera al original en tareas de tool calling.
Conway Research, la firma detrás del asistente on‑device Underdog, ha puesto a disposición de la comunidad el modelo Saluki 27B bajo licencia Apache 2.0. Se trata de una compresión de 2 bits del modelo Qwen3.8‑27B que reduce su tamaño de 54 GB en precisión BF16 a menos de 8 GB en formato GGUF, sin perder la capacidad de ejecutar llamadas a herramientas, la funcionalidad que transforma un modelo de chat en un agente autónomo.
Compresión de 2 bits que reduce el modelo a menos de 8 GB
Saluki 27B combina tres capas de procesamiento:
- Base: el modelo denso Qwen3.8‑27B, con 27 000 millones de parámetros y 64 capas que utilizan atención lineal Gated DeltaNet y atención gated.
- Segunda capa: la variante
Qwen3.8-27B-GSQ-RCO-GGUFdesarrollada por ISTA‑DASLab, que emplea la técnica GSQ para crear rejillas escalares de bajo bit y RCO para asignar el tipo de cuantización óptimo a cada tensor, logrando archivos de 8,4 GB a 2,5 bits por peso. - Tercera capa: el paso propio de Underdog que lleva el archivo a 7,89 GB bajo el nombre
IQ2‑mixy conserva la etiquetaimatrix. Los detalles exactos del algoritmo no han sido divulgados.
Rendimiento en pruebas de referencia
Underdog evaluó Saluki 27B en dos grupos de benchmarks. En el primero, ambos modelos se ejecutaron bajo el mismo entorno de pruebas (temperatura 0, sin generación de texto). Saluki alcanzó 88 puntos en el Underdog Bench (120 tareas), frente a 84 del modelo completo y 70 del Bonsai 2 de PrismML. En pruebas de llamadas paralelas a herramientas, el modelo comprimido logró 42 éxitos contra 35 del original, lo que representa un 120 % de retención.
En el segundo grupo, se compararon resultados públicos del modelo completo con los obtenidos por Saluki:
| Benchmark | Saluki 27B | Qwen3.8‑27B (público) |
|---|---|---|
| IFEval (prompt‑loose) | 93.5 | 91.5 |
| IFBench (prompt‑loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
En promedio, el modelo comprimido retiene el 96 % del rendimiento del original, aunque muestra caídas de entre 12 y 18 puntos en razonamiento matemático multi‑paso y en pruebas de competencia matemática AIME.
Comparación con otras versiones compactas
Saluki 27B también se mide frente a otras construcciones de Qwen3.8‑27B en formato GGUF. La tabla siguiente resume las principales diferencias de tamaño y precisión:
- Qwen3.8‑27B (BF16): 54 GB, precisión de referencia.
- ISTA GSQ‑RCO IQ2_XS: 8,4 GB, 2,5 bits por peso, manteniendo la mayor parte de la capacidad de atención.
- PrismML Bonsai 2 27B (PTQ1_0): 10 GB, enfoque en inferencia rápida pero con mayor pérdida en tareas de razonamiento.
Saluki logra el mejor equilibrio entre tamaño (<8 GB) y retención de capacidad de tool calling, lo que lo hace particularmente atractivo para dispositivos locales con GPU de consumo o incluso para CPU mediante llama.cpp con descarga completa a GPU.
Implicaciones para desarrolladores en Latinoamérica y España
El hecho de que Saluki 27B pueda ejecutarse con llama.cpp y ocupar menos de 8 GB abre la puerta a su adopción en entornos con recursos limitados, comunes en startups y centros de investigación de la región. En México, Colombia y Argentina, donde la infraestructura de nube suele ser más costosa, los equipos pueden ahora montar agentes de IA avanzados en servidores de gama media o incluso en laptops con GPU de 12 GB de VRAM.
En España, la reciente iniciativa del Ministerio de Asuntos Económicos y Transformación Digital para impulsar la IA local se alinea con esta oferta: Saluki permite cumplir con los requisitos de soberanía de datos al mantenerse “on‑device”, sin necesidad de enviar información sensible a la nube.
Los desarrolladores también ganan flexibilidad para añadir complementos de visión de 629 MB o 928 MB, lo que habilita aplicaciones de reconocimiento de imágenes sin depender de servicios externos. La comunidad de código abierto podrá ahora experimentar con agentes que combinan lenguaje y visión en hardware de escritorio, reduciendo la barrera de entrada para proyectos de automatización industrial, asistentes de atención al cliente y herramientas de educación personalizada.
En definitiva, Saluki 27B representa un paso significativo hacia la democratización de modelos de agente de gran escala en la región ibero‑americana, ofreciendo una alternativa competitiva frente a los modelos propietarios que requieren infraestructuras de varios cientos de gigabytes.
