...

OpenAI presenta GPT-6.1 Sol: potencia para agentes a una quinta parte del coste

OpenAI presenta GPT-6.1 Sol: potencia para agentes a una quinta parte del coste

La compañía actualiza su modelo intermedio para ofrecer un rendimiento cercano a su versión más potente en programación y control de ordenadores, reduciendo drásticamente la factura de cómputo.

El desarrollo de agentes autónomos capaces de programar, interactuar con interfaces gráficas y resolver problemas complejos suele chocar contra el mismo muro: la factura de la API. Ejecutar bucles continuos de razonamiento donde el sistema reevalúa sus decisiones a cada paso consume millones de tokens y dispara los costes operativos. Para responder a este cuello de botella, OpenAI ha presentado gpt-6.1-sol, una versión evolucionada de su modelo de gama media que busca ofrecer capacidades casi idénticas a su motor insignia a una fracción de su precio.

Una reestructuración de costes pensada para la ejecución continua de agentes

La nueva arquitectura reemplaza al modelo previo de la serie Sol y se posiciona justo debajo del modelo superior de la firma. La diferencia en la tarifa de procesamiento es sustancial: mientras que el modelo insignia mantiene un coste de 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida, GPT-6.1 Sol reduce estas cifras a 2 dólares por entrada y 10 dólares por salida. Para tareas livianas o de ultra bajo coste, la compañía mantiene disponible la versión Luna a tarifas marginales.

El avance más relevante para los desarrolladores de sistemas de agentes no está solo en la tarifa base, sino en la lectura de memoria en caché. Los agentes de software reenvían constantemente las mismas instrucciones de sistema, esquemas de herramientas e historial acumulado en cada iteración del proceso. En este escenario, la lectura de datos cacheados en GPT-6.1 Sol ha bajado a 0,10 dólares por millón de tokens, lo que representa un descuento del 95% respecto a la entrada no cacheada y reduce a la mitad el coste de almacenamiento que ofrecía su predecesor.

En cuanto a las especificaciones operativas, el modelo mantiene una ventana de contexto masiva de 1.050.000 tokens de entrada y una capacidad máxima de generación de 128.000 tokens por respuesta, respaldado por un corte de conocimiento fijado a finales de abril de 2026. Acepta entradas multimodales de texto e imagen y devuelve únicamente salidas de texto.

Rendimiento verificado en programación y tareas profesionales

Los datos de rendimiento publicados por el proveedor muestran que la reducción de coste no ha conllevado un deterioro proporcional en la calidad del procesamiento. En las evaluaciones comparativas de ingeniería de software sobre el conjunto de pruebas DeepSWE v1.1, GPT-6.1 Sol iguala los resultados del modelo superior de la familia consumiendo solo un 20% del presupuesto de cómputo, superando además la puntuación de la versión Sol anterior en 6,4 puntos porcentuales con un menor esfuerzo de razonamiento.

En tareas administrativas y análisis documental complejo probados sobre GDP.pdf, el modelo supera a alternativas del mercado como Claude Opus 5.5 manteniendo menos de la mitad del coste por tarea completada. Por su parte, en el entorno de automatización de entorno de escritorio OSWorld 2.0, la nueva versión incrementa su puntuación en 7 puntos respecto a la generación previa, situándose a solo 2,1 puntos del modelo de máxima categoría a una séptima parte del precio.

Prueba de rendimiento GPT-6.1 Sol Rival / Alternativa Diferencial de coste
DeepSWE v1.1 (Código) Iguala al modelo superior +6.4% sobre GPT-6 Sol 80% más económico que el nivel insignia
GDP.pdf (Documentos) Líder en precisión Supera a Claude Opus 5.5 Menos de la mitad de coste por tarea
OSWorld 2.0 (Uso de PC) A 2.1 puntos de la cúspide +7 puntos sobre versión anterior 1/7 del coste de la gama más alta
Terminal-Bench Science $5.47 coste promedio / tarea $23.21 en Opus 5.5 / $23.80 en Astra Reducción del 77% en gasto científico

La tasa de alucinaciones o errores factuales también muestra un ajuste medible. En conversaciones intencionadamente complejas que recopilan fallos reportados en versiones previas, la proporción de respuestas con errores de hechos cayó del 11,4% al 7,7% cuando el modelo se ejecuta en niveles bajos de esfuerzo de pensamiento, lo que representa una mejora en la precisión del 32%.

Ajustes en la API y parámetros para el despliegue en producción

El control del esfuerzo cognitivo del modelo se gestiona mediante el parámetro reasoning.effort, que admite los valores low, medium (configurado por defecto), high, xhigh y max. Las opciones de pensamiento nulo o mínimo no están respaldadas en esta versión. Para el uso de herramientas estructuradas, la compañía exige la migración hacia la API de Responses, manteniendo la API de Chat Completions únicamente para interacciones conversacionales simples sin llamadas a funciones.

La estructura tarifaria introduce además una regla para contextos masivos: cualquier petición cuya entrada supere el umbral de los 272.000 tokens duplicará la tarifa de procesamiento y de caché, incrementando un 50% la tarifa de salida para la totalidad de esa solicitud. Por otro lado, las modalidades Batch y Flex aplican un descuento del 50%, mientras que el modo de respuesta rápida duplica el precio estándar.

OpenAI ha confirmado que el modelo ya se encuentra activo en la plataforma API, así como en los entornos ChatGPT Work y Codex, añadiendo que integrará próximamente una variante denominada Ultrafast diseñada para multiplicar hasta por ocho la velocidad de generación de texto en la herramienta para programadores.

El impacto práctico para el desarrollo de flujos de trabajo autónomos

El lanzamiento de esta arquitectura refleja una tendencia clara en la industria de la inteligencia artificial: el desplazamiento de la competición desde la fuerza bruta hacia la eficiencia de costes. Para las empresas que construyen sistemas capaces de operar sobre el ordenador de un usuario final o realizar revisiones masivas de código en integración continua, el precio por token es la métrica determinante entre la viabilidad comercial y un proyecto deficitario.

Al permitir que los modelos de gama media asuman tareas de alta complejidad sin necesidad de recurrir constantemente a las opciones más costosas, los equipos de desarrollo pueden aumentar el número de iteraciones que realiza un agente antes de entregar un resultado. Esta rebaja tarifaria altera la ecuación económica de la automatización, haciendo viable la ejecución de procesos en segundo plano que antes resultaban prohibitivos.

Créditos y referenciasInformación basada originalmente en la cobertura de MarkTechPost y contrastada de forma independiente por el equipo de redacción de Data Mindset.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Seraphinite AcceleratorOptimized by Seraphinite Accelerator
Turns on site high speed to be attractive for people and search engines.