Liquid Inference reduce hasta un 30 % el coste de inferencia al subastar cada petición

Architect Financial Technologies lanza Liquid Inference, una plataforma que subasta en tiempo real cada solicitud de modelo de lenguaje, permitiendo a los desarrolladores pagar el precio más bajo que cumpla sus requisitos.
Architect Financial Technologies ha puesto en marcha Liquid Inference, un router de inferencia que opera como un mercado donde cada petición de LLM se subasta entre proveedores. El comprador paga la oferta más barata que satisface sus reglas, y la integración se reduce a cambiar la URL base del API sin modificar el código existente.
Cómo funciona la subasta de inferencia en tiempo real
El proceso se compone de cuatro fases claramente definidas:
- Solicitud: el cliente envía una llamada API compatible con OpenAI o Anthropic, por ejemplo
POST /v1/chat/completions. - Reglas: el comprador define filtros – límite de coste por trabajo, tiempo máximo hasta el primer token, throughput mínimo, regiones permitidas o listas blancas de modelos.
- Subasta: todos los proveedores que ofrecen el modelo solicitado presentan sus precios; la oferta más baja que cumple las reglas gana la puja.
- Confirmación: el precio máximo queda bloqueado antes de iniciar la generación y la facturación se basa únicamente en el uso medido.
Los usuarios pueden activar un modo automático que elige el modelo óptimo para cada unidad de trabajo, y la plataforma muestra un libro de órdenes en vivo con cotizaciones por proveedor y por modelo, algo inusual en los APIs de LLM.
Ventajas para desarrolladores y proveedores
Para los desarrolladores, Liquid Inference ofrece una compatibilidad directa con herramientas de código agente como Claude Code, Codex, OpenCode, Cursor, Pi y Cline. Además, los primeros 500 usuarios reciben $20 de inferencia gratuita y existe un programa de referidos que otorga un 20 % de inferencia gratuita por cada cliente referido, más un 10 % adicional en el segundo nivel.
Los proveedores, por su parte, se registran a través de la aplicación dedicada y pueden publicar cotizaciones en tiempo real. Según Harrison, «Los proveedores se verifican en minutos, no en semanas».
«Los proveedores se verifican en minutos, no en semanas», declaró Harrison, cofundador de Architect.
Esta rapidez permite que los operadores ofrezcan capacidad de GPU ociosas solo cuando les resulta rentable. Los pagos se gestionan mediante Stripe, con registros desglosados por cada trabajo ejecutado.
Comparativa con OpenRouter y Hugging Face
| Feature | Liquid Inference | OpenRouter | Hugging Face Inference Providers |
|---|---|---|---|
| Routing model | Subasta por petición entre proveedores que cotizan | Balanceo de carga ponderado por precio (inverso al cuadrado del precio) | Proveedor más rápido por defecto; sufijo :cheapest opcional |
| Model / provider count | «Cientos» de modelos; proveedores no divulgados | Más de 500 modelos, 80+ proveedores | 18 proveedores listados oficialmente |
Perspectivas para el ecosistema de IA
Liquid Inference introduce un mecanismo de descubrimiento de precios de dos caras que, hasta ahora, era exclusivo de los mercados financieros. Al trasladar esa dinámica al ámbito de la inferencia, la solución podría presionar a los grandes proveedores a optimizar sus costos operativos, beneficiando a los desarrolladores con precios más competitivos.
Sin embargo, la dependencia de un modelo de subasta también plantea retos de latencia y predictibilidad de costos en aplicaciones críticas. Los usuarios que requieran tiempos de respuesta garantizados deberán combinar reglas de tiempo máximo a primer token con márgenes de precio, lo que podría reducir la ventaja de coste en ciertos casos.
En el corto plazo, la adopción dependerá de la capacidad de los proveedores para ofrecer cotizaciones fiables y de la facilidad de integración con pipelines existentes. Si la plataforma logra escalar su libro de órdenes y atraer a un número suficiente de proveedores, podría convertirse en un punto de referencia para la economía de la inferencia de IA.
