...

Una técnica de Nvidia recorta hasta un 49% el consumo de tokens en agentes de código

Una técnica de Nvidia recorta hasta un 49% el consumo de tokens en agentes de código

Investigadores de Nvidia, el MIT y la Universidad Tecnológica de Nanyang presentan SoL-Pi, una extensión de código abierto que optimiza la capa de ejecución de los agentes de programación para reducir significativamente la factura de la API.

Los agentes de programación impulsados por inteligencia artificial han pasado de ejecutar pequeñas tareas puntuales a sostener sesiones complejas de refactorización y depuración que se extienden durante horas. Sin embargo, esta autonomía prolongada plantea un reto económico y técnico severo: cada edición de archivo, ejecución de prueba y lectura de registros de errores vuelve a inyectarse en la ventana de contexto del modelo. Con el fin de frenar esta hemorragia de cómputo, un equipo conjunto de investigadores de Nvidia, la Universidad Tecnológica de Nanyang (NTU) y el MIT ha desarrollado SoL-Pi, una extensión capaz de recortar el tráfico de tokens entre un 44,7% y un 49,0% sin degradar la capacidad de resolución de problemas.

Optimizar la infraestructura intermedia en lugar del modelo

Durante años, los esfuerzos de optimización en la industria de la IA se han enfocado de forma casi exclusiva en el propio modelo de lenguaje mediante cuantización, aceleración de kernels o el uso de arquitecturas más pequeñas. El enfoque de SoL-Pi cambia el ángulo del problema: en lugar de abaratar el costo por token individual, reduce drásticamente la cantidad de tokens que exige la ejecución de una tarea completa.

El punto clave de esta intervención es el denominado harness o marco de ejecución, la capa de software intermedia encargada de gestionar las llamadas a herramientas, la conservación del contexto, el análisis de observaciones y la delegación de subtareas. Ajustar este componente de forma manual suele ser un proceso lento y propenso a fallos, ya que una modificación puntual en la gestión de variables puede encarecer las fases posteriores. Para resolver esta rigidez, los científicos utilizaron bucles de auto-investigación guiados por IA sobre la herramienta de código abierto Pi, analizando más de 3.000 ejecuciones y 60.000 interacciones entre agentes y entornos de prueba.

Los cuatro mecanismos de eficiencia descubiertos por la propia IA

Tras evaluar 152 direcciones de optimización en cientos de entornos derivados de problemas reales de GitHub, la investigación aisló cuatro patrones de comportamiento altamente efectivos que ahora forman la base de SoL-Pi:

  • Action Fusion: Combina la modificación de archivos y la posterior orden de compilación o prueba en una sola solicitud a la API. Al empaquetar ambas acciones y devolver sus resultados en una única respuesta, se elimina un viaje de ida y vuelta completo al modelo.
  • Online Context Compact: Supervisa los pasos del plan mediante la función update_plan. Antes de reescribir la memoria caché, calcula si el ahorro proyectado de tokens de entrada supera el costo computacional de refrescar la caché. La compactación se activa únicamente cuando la balanza es favorable o cuando la memoria roza el límite de la ventana de contexto.
  • ObservationPack: Gestiona las salidas de herramientas que superen los 10 KiB. En lugar de saturar el contexto enviando archivos pesados de forma continuada, conserva el resultado completo localmente durante dos peticiones y, a partir de la tercera, sustituye el texto masivo por un identificador estable y un extracto compacto de las líneas iniciales y finales.
  • Evidence-Preserving Reducer: Detecta registros de prueba o compilación superiores a 4 KiB y los deriva a un modelo secundario más económico, como GPT-5.6 Luna, para generar un recibo de verificación conciso. Un verificador determinista valida que la estructura y el código hash sean correctos antes de enviar la versión reducida al agente principal.
Métrica evaluada (Benchmark EdgeBench) Agente Pi Estándar Agente con SoL-Pi Impacto Directo
Tráfico de tokens 100% (Línea base) 51,0% – 55,3% Reducción de hasta el 49,0%
Gasto en llamadas a la API 100% (Costo nominal) ~67,0% Ahorro económico del 33%
Precisión en resolución de código Referencia original Sin variaciones significativas Mantiene tasa de éxito en GPT-5.6 Sol y Opus 5

La encrucijada del coste computacional en los agentes de desarrollo

El lanzamiento de SoL-Pi bajo licencia MIT en el repositorio oficial de NVlabs demuestra que la viabilidad comercial de la inteligencia artificial no depende únicamente de la potencia de los grandes modelos de lenguaje, sino de la eficiencia de la capa de integración. Al empaquetar estos mecanismos en un módulo compatible con las versiones actuales de Node.js y la distribución base de Pi 0.85.1, Nvidia ofrece a los equipos de desarrollo una vía inmediata para recortar gastos fijos sin esperar a nuevas bajadas de tarifas por parte de los proveedores de infraestructura.

Este avance deja al descubierto un patrón cada vez más evidente en la industria: la congestión de datos en el software impulsado por IA se resuelve mejor mediante decisiones de arquitectura inteligentes que añadiendo más capacidad bruta de procesamiento. Conforme los agentes asuman tareas de ingeniería de mayor envergadura, el verdadero diferencial competitivo estará en la capacidad de minimizar el ruido computacional sin perder el hilo de la razonabilidad técnica.

Créditos y referenciasInformación basada originalmente en la cobertura de MarkTechPost y contrastada de forma independiente por el equipo de redacción de Data Mindset.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Seraphinite AcceleratorOptimized by Seraphinite Accelerator
Turns on site high speed to be attractive for people and search engines.