Los fallos ocultos de la IA: el sistema que audita cómo piensa

Evaluar a la inteligencia artificial solo por sus respuestas finales oculta miles de errores internos. Un nuevo análisis revela diferencias abismales entre los modelos líderes de la industria.
Un modelo de inteligencia artificial puede resolver un problema científico complejo con un 89% de precisión y, aun así, estar actuando de manera completamente caótica por dentro. Durante años, la industria de la tecnología ha evaluado a sus sistemas más avanzados basándose exclusivamente en el resultado final: si el código funciona, si la hipótesis es correcta o si el informe técnico parece convincente. Sin embargo, evaluar únicamente el destino final ignora por completo el camino recorrido, permitiendo que sesgos, atajos metodológicos y puras casualidades afortunadas se hagan pasar por razonamiento científico genuino.
Para romper con esta opacidad, un equipo internacional de investigadores ha hecho pública la plataforma OpenDiscoveryTrace, una base de datos pública que registra y analiza el proceso de pensamiento paso a paso de los agentes autónomos. A través de un desglose exhaustivo publicado en una investigación dada a conocer esta semana, los expertos han demostrado que dos modelos de IA con el mismo porcentaje de éxito pueden comportarse de formas diametralmente opuestas durante la resolución de un problema.
La trampa de juzgar a la inteligencia artificial solo por la meta
Hasta ahora, los puntos de referencia tradicionales (o benchmarks) trataban a los modelos como cajas negras. Se les introducía una pregunta compleja sobre genómica o ciencia de materiales, y se calificaba la respuesta final entregada por el sistema. Este enfoque ha permitido a los gigantes tecnológicos presumir de porcentajes de efectividad espectaculares en sus campañas de mercadotecnia, ocultando los fallos estructurales que ocurren entre el inicio y el fin de la tarea.
El nuevo conjunto de datos audita 558 ejecuciones completas de agentes de IA enfrentados a 124 tareas científicas de alta complejidad, abarcando áreas como el descubrimiento de fármacos, la síntesis de nuevos materiales y la literatura médica. En lugar de mirar únicamente la conclusión, cada interacción registra nueve parámetros clave por cada paso ejecutado, entre los que se incluyen:
- Pensamientos internos y plan de acción: La lógica explícita formulada por la IA antes de actuar.
- Llamadas a herramientas externas: Cómo interactúa el modelo con bases de datos, APIs o ejecuciones de código.
- Errores operativos y desencadenantes de revisión: La frecuencia con la que la IA se equivoca y qué la lleva a corregir su rumbo.
- Nivel de confianza autoinformado: La seguridad matemática que el sistema afirma tener en cada decisión.
Claude comete 30 veces más errores que GPT, pero nadie lo notaba
Los primeros hallazgos de este análisis revelan una realidad incómoda para la industria. Al comparar los modelos de frontera más potentes del mercado —GPT-5.4 de OpenAI, Claude Opus 4.6 de Anthropic y Gemini 3.1 Pro de Google— los investigadores descubrieron que los tres logran tasas de éxito casi idénticas, situadas entre el 84% y el 89%. En una evaluación tradicional, los tres habrían recibido una calificación sobresaliente equitativa.
Sin embargo, al examinar la traza completa de sus razonamientos, las discrepancias son alarmantes. Claude Opus 4.6 genera en promedio 2,5 errores operativos por trayectoria, mientras que GPT-5.4 apenas registra 0,08 errores por prueba. Es decir, el modelo de Anthropic tropieza 30 veces más que el de OpenAI antes de llegar a la misma respuesta.
La naturaleza de estos fallos también difiere sustancialmente. El 66,7% de los tropiezos de Claude se deben a un uso indebido de herramientas (intentos fallidos de formatear código, sintaxis incorrecta o llamadas erróneas a APIs), actuando mediante un proceso agresivo de ensayo y error. En cambio, cuando GPT-5.4 se equivoca, el 83,6% de sus fallos corresponde a errores puros de razonamiento deductivo. Ambas inteligencias artificiales entregan el trabajo terminado, pero una lo hace mediante una torpe improvisación técnica y la otra a través de fallos de lógica formal.
Del marketing del rendimiento a la auditoría técnica
La publicación de este registro abierto evidencia por qué muchas multinacionales tecnológicas se han mostrado reticentes a abrir las tripas de sus modelos. Mostrar únicamente la puntuación final permite vender la IA como una entidad analítica infalible, cuando en realidad muchos de estos sistemas avanzan dando palos a ciegas en la oscuridad digital hasta dar con la combinación correcta.
El estudio no se limitó a los grandes modelos comerciales; también evaluó alternativas de código abierto con pesos accesibles como Qwen2.5, Mistral-7B y Phi-3.5. Como era de esperar, los modelos más pequeños sufren un índice de descarrilamiento mucho mayor, pero la posibilidad de trazar exactamente dónde colapsa su cadena de lógica abre la puerta a que la comunidad de código abierto pueda corregir fallos concretos sin necesidad de reentrenar modelos enteros desde cero.
Evaluar el razonamiento intermedio mediante aprendizaje automático permitirá a los desarrolladores diseñar herramientas que detecten cuándo un agente se ha desviado de su objetivo, previniendo alucinaciones antes de que se consoliden en la respuesta definitiva.
💡 El panorama general: ¿Cómo nos afecta esto?
La transición hacia una evaluación basada en el proceso y no solo en el resultado es un paso crítico si pretendemos delegar responsabilidades reales en la inteligencia artificial. En disciplinas de alto impacto como la medicina, la ingeniería aeronáutica o el desarrollo de medicamentos, una respuesta correcta obtenida mediante un proceso defectuoso no es un logro: es un peligro invisible. Si un agente de IA diseña un fármaco válido pero cometió cinco violaciones de lógica durante la simulación molecular que pasaron desapercibidas, el riesgo operacional en fases posteriores se multiplica de manera catastrófica.
Este nivel de fiscalización cambiará de forma inevitable el debate sobre la regulación y la gobernanza de la IA. Las normativas futuras no podrán limitarse a exigir que un sistema pase pruebas estandarizadas, sino que deberán auditar la trazabilidad de sus decisiones. Para las empresas que despliegan agentes autónomos en sus flujos de trabajo, este tipo de auditorías revelará el costo oculto de la computación: un modelo que comete 30 veces más errores consumirá más energía, ejecutará más llamadas a servidores y requerirá mayor supervisión humana, aunque el folleto publicitario prometa la misma precisión.
En última instancia, exigir que los modelos de inteligencia artificial expliquen y sostengan con rigor cada paso de su lógica es el único antídoto contra la ilusión de soberanía cognitiva. La verdadera utilidad de estos sistemas no residirá en su capacidad para adivinar respuestas correctas, sino en la transparencia y solidez de su método.
