...

OpenLayer AI lanza jevals y reemplaza jueces LLM por decisiones tipadas en milisegundos

OpenLayer AI lanza jevals y reemplaza jueces LLM por decisiones tipadas en milisegundos

OpenLayer AI presenta jevals, una biblioteca que sustituye los costosos jueces LLM por modelos de decisiones tipadas, reduciendo la latencia a cientos de milisegundos y el gasto a fracciones de centavo.

En un ecosistema donde cada llamada a un modelo de gran escala puede costar varios centavos y añadir segundos de espera, OpenLayer AI ha lanzado jevals, una herramienta que permite evaluar trazas de agentes de IA con una única petición HTTP, en menos de 400 ms y por menos de una milésima de centavo.

Cómo funciona jevals con decisiones tipadas en una sola petición

En lugar de delegar la valoración a un modelo generativo que redacta un párrafo y un JSON, jevals envía al motor una estructura de estado y una lista de preguntas tipadas (sí/no, opción múltiple o puntuación en una rúbrica). Cada pregunta se evalúa de forma independiente y paralela, devolviendo una probabilidad calibrada. La arquitectura se asemeja a un examen de opción múltiple: el estudiante (el modelo) no escribe ensayos, solo marca la respuesta correcta, lo que permite que 40 preguntas cuesten prácticamente lo mismo que una sola.

El proceso se resume en tres pasos:

  • state(): extrae del historial del agente los elementos relevantes (respuesta final, llamadas a herramientas, resultados).
  • questions(): define qué se quiere comprobar, por ejemplo “¿Se usó la herramienta adecuada?” o “¿La respuesta es fiel a la evidencia?”.
  • reduce(): convierte las probabilidades en una puntuación única que puede servir como métrica o como disparador de un gate en producción.

Ventajas económicas y de latencia frente a los jueces LLM tradicionales

Los sistemas de evaluación convencionales, como los que emplean Ragas, requieren múltiples llamadas a grandes modelos: dos para verificar la fidelidad, tres para la relevancia, una por cada fragmento recuperado, etc. Un solo trazado puede generar entre seis y once viajes de ida‑y‑vuelta, lo que se traduce en varios segundos de espera y en costos que obligan a las organizaciones a muestrear apenas el 1 % del tráfico.

Jevals, por su parte, factura $0.042 por millón de tokens de entrada y no cobra por tokens de salida. En pruebas realizadas a través del gateway de Vercel, el percentil 50 de latencia fue de 244 ms y el percentil 95 de 371 ms. En comparación, un juez LLM como GPT‑4 o Claude puede tardar varios segundos y presentar una variabilidad de puntuación entre 92× y 913× en trazas idénticas, lo que dificulta la reproducibilidad de los tests.

Integración y flexibilidad con diferentes backends

Jevals está diseñado para ser agnóstico al motor subyacente. Funciona con la API TypeSafe o Vercel, pero también permite ejecutar modelos locales como Kev (basado en Qwen‑3) o Laya (ModernBERT) en una Mac con Apple Silicon, logrando latencias de alrededor de 10 ms. Además, cualquier servicio que hable el formato “System One” puede actuar como backend, incluso los LLM de OpenAI o Anthropic mediante un prompt que solicite probabilidades.

La biblioteca expone una API sencilla en Python 3.10+: evaluate(sample, evals, backend="kev://localhost:8009"). Cambiar de backend no requiere modificar las definiciones de evaluación; solo se recalibran las probabilidades para mantener la coherencia. Próximamente se lanzará un paquete TypeScript, lo que ampliará su adopción en proyectos que ya usan el AI SDK.

Impacto para desarrolladores y equipos de IA

Para los equipos que construyen agentes autónomos, jevals representa un cambio de paradigma. La misma definición de evaluación puede servir como métrica offline, monitor en producción y gate dentro del bucle de decisiones del agente. Eso elimina la brecha entre lo que se prueba en laboratorio y lo que se controla en tiempo real.

Imagínese un asistente que, antes de ejecutar una herramienta, verifica en milisegundos si esa herramienta es la más adecuada, si el resultado se utilizó correctamente y si la conversación se mantiene dentro del alcance definido. Con jevals, esa verificación pasa de ser opcional a ser parte integral del flujo, sin inflar los costos.

Además, al no depender de generación de texto, el riesgo de respuestas no determinísticas desaparece. Cada ejecución entrega la misma probabilidad para la misma entrada, lo que facilita la auditoría y la trazabilidad de decisiones críticas.

Jevals no solo reduce la carga económica de la evaluación, sino que también abre la puerta a pipelines de control más robustos, donde la precisión y la rapidez dejan de ser compromisos.

Créditos y referenciasInformación basada originalmente en la cobertura de Hacker News y contrastada de forma independiente por el equipo de redacción de Data Mindset.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Seraphinite AcceleratorOptimized by Seraphinite Accelerator
Turns on site high speed to be attractive for people and search engines.