OpenAI comenzó a desplegar GPT-6 Astra, su nuevo modelo insignia, con la promesa de realizar tareas profesionales más complejas, operar computadoras y llevar la inteligencia artificial a un nuevo nivel en programación y ciberseguridad. La compañía asegura que marca un nuevo estado del arte, aunque los resultados frente a Anthropic muestran una competencia mucho más cerrada.
La carrera por desarrollar la inteligencia artificial más poderosa tiene un nuevo participante. OpenAI presentó oficialmente GPT-6 Astra el pasado 3 de septiembre y comenzó a ofrecerlo inicialmente a un grupo limitado de organizaciones, antes de ampliar gradualmente su disponibilidad.
A diferencia de modelos diseñados principalmente para responder preguntas o generar contenido, Astra apuesta con mayor fuerza por el trabajo autónomo: puede utilizar software, navegar por internet y realizar procesos de varios pasos, además de crear documentos, presentaciones y hojas de cálculo siguiendo instrucciones y plantillas proporcionadas por el usuario.
Uno de los avances más relevantes —y también de los que más preocupan a OpenAI— está en la ciberseguridad.
GPT-6 Astra es el primer modelo de la compañía que alcanza el nivel “Critical” o crítico dentro de su Preparedness Framework. Según OpenAI, con las herramientas y permisos adecuados, el sistema puede encontrar vulnerabilidades previamente desconocidas y desarrollar formas de explotarlas incluso en sistemas bien protegidos, sin necesitar que una persona supervise cada paso.
Precisamente por esta capacidad, la empresa asegura haber reforzado las barreras de seguridad, el monitoreo y los controles utilizados durante su operación.
Depende de la prueba.
Los datos publicados por OpenAI colocan a Astra por encima de algunos de los modelos de Anthropic en diferentes evaluaciones. Por ejemplo, obtuvo 64.6% en Terminal-Bench Science 0.1, frente a 52.6% de Claude Fable 5.1; mientras que en Terminal-Bench 4.0, enfocado en tareas realizadas desde una terminal, Astra alcanzó 57.9% y Fable 5.1 registró 55.8%.
También mostró una amplia ventaja en algunas pruebas relacionadas con razonamiento abstracto y ciberseguridad.
Pero decir que OpenAI ya venció definitivamente a Anthropic sería exagerado.
En Humanity's Last Exam con herramientas, por ejemplo, Claude Fable 5.1 obtuvo 65%, mientras Astra registró 57.2%. En el Artificial Analysis Intelligence Index publicado en la propia comparación de OpenAI, Fable 5.1 también aparece con 65.7 puntos frente a 61.2 de Astra. Algunas evaluaciones de programación muestran igualmente diferencias pequeñas a favor de modelos de Anthropic.
Los benchmarks, además, evalúan habilidades específicas y sus resultados pueden cambiar dependiendo de las herramientas, configuraciones y condiciones utilizadas durante cada prueba.
OpenAI inició el lanzamiento con acceso para un número limitado de organizaciones y anunció un despliegue progresivo para usuarios de ChatGPT Plus, Pro, Business y Enterprise, además de su API y servicios empresariales.
Por ahora, el lanzamiento deja algo claro: la diferencia entre los principales laboratorios de inteligencia artificial es cada vez más difícil de resumir con la frase “este modelo es el mejor”.
GPT-6 Astra consigue resultados extraordinarios en determinadas tareas y representa un salto importante para OpenAI, especialmente en agentes, ciencia y ciberseguridad. Pero Anthropic continúa encabezando otras evaluaciones.
Así que sí: OpenAI puede presumir haber superado a Anthropic en varios terrenos. Decir que ya ganó la carrera completa es otra historia.