La nueva IA de OpenAI supera la eficiencia humana y reabre el debate

El rendimiento contradictorio de GPT-6 Astra en las evaluaciones independientes plantea serias dudas sobre los métodos actuales para medir la inteligencia artificial.
¿Hasta qué punto podemos confiar en las pruebas con las que medimos el avance hacia la inteligencia artificial general? La reciente aparición de GPT-6 Astra, el nuevo y esperado modelo de OpenAI, ha provocado una marejada de reacciones encontradas en la industria tecnológica. Mientras algunos análisis lo coronan como el líder indiscutible del sector, otras evaluaciones independientes sugieren que apenas supera a su predecesor y que queda por detrás de competidores clave como Claude Fable 5.1. Sin embargo, un dato inesperado en una de las evaluaciones más rigurosas del panorama actual ha vuelto a encender todas las alarmas sobre la velocidad real del progreso.
Entre la gloria y la discrepancia: la guerra de las métricas
La narrativa oficial de las grandes tecnológicas sobre el progreso ininterrumpido de la inteligencia artificial está empezando a mostrar grietas en sus propias herramientas de medición. Por un lado, la firma de investigación Epoch AI sitúa a GPT-6 Astra en lo más alto de su clasificación global con 169 puntos, alabando su capacidad de procesamiento y su destreza en tareas complejas de razonamiento. Por el otro, los análisis detallados de la plataforma Artificial Analysis ofrecen un diagnóstico radicalmente opuesto: según sus pruebas de rendimiento, el nuevo modelo de OpenAI no representa un salto significativo respecto a la generación anterior y se ve superado en varios frentes por la arquitectura de Anthropic.
Esta disparidad tan marcada entre dos de los referentes más respetados del sector no es un mero detalle técnico; refleja una crisis metodológica en la forma en que evaluamos estos sistemas. Como señala un análisis publicado por The Decoder, la divergencia entre métricas deja al descubierto la creciente fragilidad de las evaluaciones tradicionales, muchas de las cuales sufren de contaminación de datos o están excesivamente optimizadas para responder a patrones específicos en lugar de demostrar un razonamiento genuino.
ARC-AGI-3 y el espejismo de la eficiencia sobrehumana
El verdadero giro de esta historia no procede de los exámenes habituales de opción múltiple ni de las pruebas de programación memorizada, sino del test ARC-AGI-3 (un conjunto de problemas visuales y lógicos diseñado explícitamente para evaluar la capacidad de resolver tareas completamente nuevas sin entrenamiento previo). En esta prueba, GPT-6 Astra ha logrado un hito inédito: resolver los acertijos conceptuales con una eficiencia energética y computacional superior a la del promedio humano.
Históricamente, los modelos de lenguaje requerían millones de intentos o una fuerza bruta de cálculo desproporcionada para aproximarse a la lógica intuitiva de una persona. Que un sistema ejecute este tipo de razonamiento abstracto gastando menos recursos por decisión que un cerebro humano representa un avance técnico de primer orden. No obstante, conviene mantener la cautela. Este rendimiento no implica que el sistema «piense» o entienda el mundo como lo hace una persona, sino que ha encontrado un atajo matemático extraordinariamente optimizado para manipular patrones espaciales y lógicos en tiempo real.
El adelanto del calendario: ¿estamos realmente más cerca de la AGI?
François Chollet, creador del desafío ARC Prize y una de las voces más escépticas y rigurosas del ámbito de la inteligencia artificial, no ha dudado en calificar este resultado como un toque de atención para toda la comunidad científica. Aunque Chollet insiste en que esto no constituye una prueba definitiva de haber alcanzado la Inteligencia Artificial General (AGI), sí ha reconocido públicamente que el ritmo de avance se está multiplicando. Tras observar estos resultados, el investigador ha decidido ajustar sus propias previsiones, adelantando a la mitad del tiempo estimado su pronóstico sobre cuándo podríamos ver sistemas verdaderamente autónomos y adaptativos.
Este cambio de postura resulta especialmente revelador. Chollet se ha caracterizado durante años por denunciar las promesas exageradas de Silicon Valley y por argumentar que los modelos probabilísticos de gran escala estaban llegando a un techo infranqueable. Que una figura de su perfil admita que el progreso se está acelerando al doble de la velocidad esperada obliga a reconsiderar si las arquitecturas híbridas actuales tienen más recorrido del que sus detractores predecían.
💡 El panorama general: ¿Cómo nos afecta esto?
El debate en torno a GPT-6 Astra expone una realidad incómoda: la velocidad del desarrollo tecnológico está sobrepasando nuestra capacidad para medirla y regularla con precisión. Si los propios laboratorios e investigadores independientes no logran ponerse de acuerdo sobre si un modelo es revolucionario o estancado, resulta sumamente complejo para las instituciones gubernamentales y las empresas tomar decisiones informadas sobre el despliegue de estas herramientas en sectores críticos como la salud, la finanzas o la infraestructura clave.
Por otro lado, la mayor eficiencia demostrada en tareas de razonamiento puro anticipa una transformación inminente en la automatización del trabajo cognitivo. Ya no estamos hablando únicamente de generar texto o código repetitivo, sino de sistemas capaces de resolver imprevistos lógicos en tiempo real con un consumo energético reducido. Esto reducirá drásticamente los costes operacionales de implementar agentes autónomos en la industria, acelerando la sustitución de tareas complejas pero estructuradas.
En última instancia, el acortamiento en los plazos hacia la AGI plantea una urgencia ética sin precedentes. Si nos acercamos a sistemas con capacidad de adaptación general antes de lo previsto, los marcos de seguridad, la trazabilidad de decisiones y la gobernanza de la propiedad intelectual deben evolucionar al mismo ritmo acelerado. La ventana de tiempo para diseñar salvaguardas efectivas se está cerrando mucho más rápido de lo que la política tradicional es capaz de reaccionar.
