viernes, septiembre 4, 2026
viernes, septiembre 4, 2026

Lo más visto

spot_img

RElacionado

OpenAI lanza GPT-6 Astra: alcanza un 99,9% en ARC-AGI-3 y supera la eficiencia humana en el 96% de sus niveles

OpenAI ha anunciado por sorpresa GPT-6 Astra, su modelo de Inteligencia Artificial más avanzado hasta la fecha y del que se ha estado especulando muchísimo por lo disruptivo que supuestamente era. La compañía habla de mejoras en prácticamente todos los frentes, desde el uso autónomo del ordenador hasta programación, ciencia o ciberseguridad. Ahora bien, el dato más sorprendente lo encontramos en ARC-AGI-3, donde obtuvo una puntuación del 99,9% frente al 7,8% de GPT-5.6 Sol. ¿Estamos ante el precursor de la Inteligencia Artificial General por primera vez en la historia?

Responder es complicado, porque una cosa son los datos y otra muy distinta el desempeño real. En cualquier caso, no estamos hablando de una prueba convencional basada en responder preguntas. ARC-AGI-3 coloca al modelo frente a entornos interactivos desconocidos, obligándolo a experimentar, descubrir sus reglas y adaptar su comportamiento para resolverlos. Es así como intenta medir la capacidad de aprender y razonar ante problemas nuevos en lugar de recurrir a conocimientos memorizados durante el entrenamiento.

GPT-6 Astra pone a OpenAI a otro nivel: alcanzó la eficiencia humana en ARC-AGI-3

GPT-6 Astra Terminal-Bench-Science-0.1

GPT-6 Astra Terminal-Bench-4.0
GPT-6 Astra GPQA-Diamond
GPT-6 Astra ExploitBench

Según la ARC Prize Foundation, GPT-6 Astra superó la referencia humana de eficiencia de acciones en el 96% de los niveles. Esto significa que no solo consiguió resolver prácticamente todos los escenarios, sino que necesitó una cantidad de acciones similar o inferior a la empleada por una persona, es decir, por un ser humano convencional.

La diferencia respecto a GPT-5.6 Sol es enorme: pasamos de un 7,8% a un 99,9%. El salto, por lo tanto, es totalmente disruptivo. Pese a ello, este resultado no significa que OpenAI haya demostrado alcanzar la Inteligencia Artificial general. Astra fue evaluado con el nivel de esfuerzo T7 y mediante un entorno basado en la Responses API. La propia compañía advierte de que los resultados de investigación pueden diferir de los obtenidos posteriormente en ChatGPT y ahí está la clave del asunto realmente.

GPT-6 Astra Computer-use-safety-stress-test-(lower-is-better)

GPT-6 Astra BenchCAD-(python-tool)
GPT-6 Astra Agents’-Last-Exam

El resto de las pruebas ayuda a confirmar que no estamos únicamente ante un modelo optimizado para ARC-AGI-3. Astra alcanzó un 97,6% en FrontierMath Tier 4, frente al 83% de GPT-5.6 Sol, y elevó su puntuación en Terminal-Bench Science desde el 22,4% hasta el 64,6%. En programación también pasó del 37,3% al 57,9% en Terminal-Bench 4.0.

Incluso ayudó a desarrollar dos avances matemáticos relacionados con las distancias entre números primos. Uno de ellos redujo de 240 a 186 el límite conocido para ciertos pares de primos, mientras que el segundo mejoró una expresión que llevaba más de 80 años sin avances. El salto adelante es tremendo, y podría ser el precursor de la primera IA como AGI.

Más rápido, autónomo y también más difícil de supervisar

GPT-6 Astra comparativa 1

OpenAI también ha mejorado notablemente el uso del ordenador para tareas locales. GPT-6 Astra obtuvo un 72,6% en OSWorld 2.0, frente al 65,7% de Sol, completando las tareas en unos 40 minutos en lugar de 75. Gracias al nuevo entorno de Codex, determinadas cargas pueden terminarse hasta 1,9 veces más rápido, aunque no hablan del consumo de tokens, por ahora.

Sea como fuere, no todo son buenas noticias. Aunque Astra reduce un 53% los comportamientos graves de extralimitación y respeta mejor las instrucciones, OpenAI reconoce que puede controlar mejor qué información muestra dentro de su razonamiento. Esto dificulta detectar intenciones o acciones problemáticas observando únicamente su cadena de pensamiento.

GPT-6 Astra comparativa 4
GPT-6 Astra comparativa 3
GPT-6 Astra comparativa 2

En otras palabras, es más difícil de controlar, y esta es la parte más negativa, porque como sabemos, ninguna compañía de IA garantiza el control total de sus modelos, aunque en concreto OpenAI puso un interruptor de apagado de seguridad desde GPT-5.6 Sol, por motivos obvios.

Por tanto, GPT-6 Astra supone un salto espectacular en razonamiento, adaptación y autonomía, y al mismo tiempo, obliga a OpenAI a supervisar todas sus acciones y no limitarse a confiar en lo que el propio modelo decide mostrar. Falta que lo pongan a disposición de todos para que podamos ver de qué es capaz y si realmente es el salto adelante que prometen los números, o es simplemente otro avance más dentro del sector.

La entrada OpenAI lanza GPT-6 Astra: alcanza un 99,9% en ARC-AGI-3 y supera la eficiencia humana en el 96% de sus niveles aparece primero en El Chapuzas Informático.

 

n-d.mx