Promesa de 1 000 000 de tokens en una respuesta vs el coste prohibitivo de Gemini 4 Argon

Google DeepMind lanzó Gemini 4 Argon, el primer modelo de la serie Gemini 4 capaz de generar hasta un millón de tokens por petición, pero su precio y limitaciones técnicas plantean dudas sobre su adopción masiva.
Google DeepMind presentó Gemini 4 Argon, un modelo de gran escala que rompe el techo de 64 k tokens que limitaba a sus predecesores y promete respuestas de hasta un millón de tokens en una sola llamada. La novedad se anuncia como una solución para flujos de trabajo complejos en desarrollo de software, labores de conocimiento empresarial y defensa cibernética, pero la estrategia de precios y la ausencia de información sobre la ventana de contexto de entrada generan incertidumbre en la comunidad.
Gemini 4 Argon — la apuesta de Google por respuestas de un millón de tokens
El anuncio oficial, publicado en el blog de innovación de Google, describe a Argon como un modelo pensado para «flujos de trabajo de larga duración» en áreas que requieren razonamiento extensivo, como refactorizaciones de código, redacción de informes legales o auditorías de vulnerabilidades. La característica más llamativa es su capacidad de salida: 1M tokens, una orden de magnitud superior a los 128 k tokens que manejan actualmente modelos como Claude Opus 5.5, Claude Fable 5.1 o el recién anunciado GPT‑6 Astra.
El precio de la longitud — ¿cuánto cuesta realmente generar tanto texto?
Google publicó una tabla de precios que sitúa el costo de entrada en $2 por cada millón de tokens y el de salida en $10 por cada millón de tokens durante la fase introductoria. Los tokens de entrada almacenados en caché reciben un descuento del 95 %, reduciéndose a $0.10 por millón. Tras el periodo inicial, los precios se duplican, alcanzando $4 por entrada y $20 por salida. Un uso intensivo de la capacidad máxima de salida implicaría un gasto de $10 por cada respuesta completa de un millón de tokens, lo que, aunque competitivo frente a algunos competidores, sigue siendo una barrera para proyectos con presupuestos limitados.
Rendimiento en los benchmarks — ventajas y debilidades
DeepMind comparó a Argon con GPT‑6 Astra, Claude Opus 5.5 y Claude Fable 5.1 en dieciocho pruebas de referencia. Argon lideró en doce de ellas y empató en una, destacándose en dominios que requieren procesamiento continuo de información.
- DeepSWE v1.1 (ingeniería de software de largo horizonte): 77.9 % de precisión, superando a Opus 5.5 (74.2 %) y Astra (74.1 %).
- Vals Index (impacto económico en finanzas, código, legal y fiscal): 68.9 %, posición número uno.
- AutomationBench (ejecución empresarial end‑to‑end con Zapier): 51.3 %, también liderando el ranking.
- Harvey Legal Agent Benchmark: 19.6 % frente al 5.4 % de Astra.
- LVBench (comprensión de video largo): 91.7 %, nuevo estado del arte.
Sin embargo, Argon mostró debilidades en áreas donde la velocidad de razonamiento y la capacidad de interacción con entornos externos son críticas:
- FrontierSWE v2: 55.0 %, por debajo de Astra (65.5 %).
- Terminal‑Bench 4.0: 57.4 % contra 66.4 % de Opus 5.5.
- OSWorld‑2.0 (uso de computadora): 69.2 % frente a 72.6 % de Astra.
Un análisis independiente de Artificial Analysis señaló que, aunque Argon iguala a Astra en su «Intelligence Index», lo hace a un 60 % del costo por tarea cuando se aplican los precios con descuento, lo que sugiere una ventaja económica bajo condiciones de uso intensivo.
Implicaciones para desarrolladores, abogados y equipos de ciberseguridad
La promesa de generar documentos extensos sin necesidad de dividir la solicitud en múltiples llamadas es atractiva para programadores que necesitan refactorizaciones masivas o generación de documentación completa. En el ámbito legal y financiero, la capacidad de producir informes de varios cientos de páginas podría reducir la carga operativa de equipos de investigación.
En ciberseguridad, DeepMind entrenó a Argon para identificar, validar y parchear vulnerabilidades críticas. En la prueba CWE‑bench v1, Argon alcanzó un 68 % de efectividad, empatando por primer puesto con los modelos que operan dentro de sus propios entornos de agente. Empresas como Wiz ya están evaluando la integración de Argon en sus plataformas de detección de amenazas.
Aunque el modelo parece listo para aplicaciones de alto valor, la falta de información sobre la ventana de contexto de entrada —es decir, cuántos tokens puede considerar antes de generar la respuesta— dificulta la planificación de su uso en escenarios que combinan entrada y salida extensas. Además, la política de «guardrails» (restricciones de seguridad) que Google está probando con socios gubernamentales sugiere que el modelo aún no está disponible sin supervisión, lo que podría retrasar su adopción en entornos críticos.
Gemini 4 Argon representa un paso notable en la ampliación de la longitud de salida de los LLM, pero su impacto real dependerá de cómo los desarrolladores gestionen los costos, la integración de guardias de seguridad y la disponibilidad de información sobre su ventana de contexto.
