Estás leyendo
OpenAI lanza GPT-6 Astra, su nuevo modelo de IA

OpenAI lanza GPT-6 Astra, su nuevo modelo de IA

  • GPT-6 Astra mejora el uso de ordenadores, programación, ciencia y ciberseguridad, con menor coste por tarea y un despliegue gradual en ChatGPT y API.
OpenAI GPT 6 Astra

OpenAI ha presentado  GPT-6 Astra , una nueva generación de su modelo de inteligencia artificial orientada a ejecutar tareas complejas con mayor autonomía, precisión y velocidad. La compañía sitúa las mejoras más relevantes en el uso de ordenadores, navegación web, ingeniería de software, investigación científica, ciberseguridad y trabajo profesional, áreas en las que el modelo combina razonamiento con capacidad para actuar sobre herramientas y aplicaciones.

El lanzamiento comienza este 4 de septiembre con un grupo limitado de organizaciones y se ampliará durante los próximos días a los usuarios de ChatGPT Plus, Pro, Business y Enterprise. GPT-6 Astra también llegará a la API de OpenAI y a AWS, donde estará disponible a través de Amazon Bedrock. Para las empresas, el cambio relevante está menos en una mejora aislada de los resultados que en la posibilidad de delegar procesos de varios pasos y obtener documentos, análisis o software terminado con menos intervención humana.

OpenAI atribuye este avance a cambios acumulados en preentrenamiento, aprendizaje por refuerzo y técnicas de alineamiento. En sus evaluaciones, Astra mejora de forma especialmente acusada frente a GPT-5.6 Sol en determinados trabajos que requieren interactuar con aplicaciones reales, conservar información durante sesiones largas y decidir cuándo puede continuar de forma autónoma y cuándo debe solicitar instrucciones.

GPT-6 Astra amplía el uso autónomo del ordenador

OpenAI GPT 6 Astra - Web
OpenAI GPT 6 Astra – Web

Una de las áreas donde OpenAI concentra el lanzamiento es el denominado «computer use». Astra puede rellenar formularios, actualizar registros en un CRM, organizar calendarios, realizar investigación en internet, trabajar con editores de documentos o analizar información con aplicaciones especializadas.

También puede encadenar actividades más técnicas. Entre los ejemplos mostrados por la compañía aparecen el diseño de una placa de circuito impreso en KiCad, la creación y comprobación de un sitio web, tareas en Power BI o la construcción de modelos 3D que posteriormente se trasladan a Unreal Engine.

En el subconjunto offline de OSWorld 2.0, diseñado para medir la capacidad de un agente para operar con interfaces informáticas, Astra obtiene un 72,6%, frente al 65,7% de GPT-5.6 Sol. OpenAI estima que completa esas tareas en unos 40 minutos de media, frente a aproximadamente 75 minutos para su predecesor, una reducción de alrededor del 47% en el tiempo por tarea.

La mejora tiene una implicación directa para el uso empresarial de agentes. El coste de automatizar un proceso depende tanto de las llamadas al modelo como del número de pasos, tokens y verificaciones necesarias hasta alcanzar un resultado aceptable. Un modelo capaz de cerrar el mismo flujo en menos iteraciones puede reducir el coste operativo aunque el precio unitario de sus tokens sea superior.

Astra alcanza además un 59,3% en Agents’ Last Exam, una evaluación sobre tareas profesionales realizadas con software real, frente al 53,6% de GPT-5.6 Sol y el 55,5% de Claude Opus 5 en la comparación publicada por OpenAI. La compañía sostiene que, en la configuración evaluada, utilizó aproximadamente un 65% menos de tokens de salida que Opus 5.

Las primeras pruebas en entornos empresariales apuntan también a la capacidad del modelo para trabajar sobre grandes volúmenes de información interna. Canva asegura que Astra recorrió un repositorio de más de 80 millones de líneas de código, escribió y analizó más de un millar de consultas contra su almacén de datos y recurrió a más de 21 fuentes internas de conocimiento y comentarios de la comunidad. Danny Wu, responsable de AI Products de la compañía, afirma que «Astra ha ofrecido algunas de las mejores y más relevantes recomendaciones que hemos visto».

Programación y proyectos que superan una ventana de contexto

OpenAI GPT 6 Astra - Mobile
OpenAI GPT 6 Astra – Mobile

La ingeniería de software constituye otro de los principales frentes del modelo. En Terminal-Bench 4.0, que incluye trabajos de programación, configuración de sistemas y análisis de datos desde un terminal, GPT-6 Astra registra un 57,9%, frente al 37,3% de GPT-5.6 Sol. En DeepSWE v1.1 alcanza un 74,1%, ligeramente por encima del 72,7% de Sol.

Parte de la mejora se traslada al funcionamiento de Codex. OpenAI está probando un sistema que permite conservar notas y recuperar información de ventanas de contexto anteriores cuando un proyecto se alarga. Hasta ahora, las sesiones extensas dependían en buena medida de procesos de compactación que resumían el trabajo previo y podían perder detalles sobre intentos fallidos, requisitos o resultados de pruebas.

Con Astra, esas ventanas anteriores pueden permanecer consultables. El modelo puede recuperar información aunque no se hubiera incorporado a sus notas, una capacidad diseñada para depuración prolongada, refactorizaciones extensas y otros trabajos de desarrollo en los que el contexto acumulado importa tanto como el código generado. La función será inicialmente experimental en Codex y OpenAI prevé convertirla en el comportamiento predeterminado para Astra más adelante.

Las pruebas realizadas por clientes iniciales apuntan en una dirección similar. CodeRabbit afirma que el modelo detectó alrededor de un 20% más de errores que su referencia y más que duplicó la tasa de detección en cambios que exigían razonar entre numerosos archivos. Canva, por otro lado, asegura haberlo probado sobre un repositorio de más de 80 millones de líneas de código y más de un millar de consultas contra su almacén de datos. Se trata de evaluaciones de las propias compañías y no de benchmarks independientes, pero ilustran el tipo de carga de trabajo que OpenAI quiere trasladar desde el chat hacia agentes de ejecución prolongada.

Esa autonomía prolongada es precisamente uno de los aspectos que destaca Datadog. Bruno Volpato, ingeniero de software de la compañía, señala: «Con Astra, puedo delegar tareas complejas de varias horas sin tener que supervisar cada paso», una descripción que encaja con el objetivo de reducir la supervisión continua durante trabajos de ingeniería que se extienden durante horas.

Ciencia y ciberseguridad elevan también los riesgos

En investigación científica, Astra alcanza un 97,6% en FrontierMath Tier 4 v2, cifra que OpenAI redondea al 98% en su presentación del modelo. La compañía había adelantado además diez resultados en matemáticas y ciencias de la computación teórica obtenidos con una versión interna de Astra y acompañados de demostraciones formalizadas en Lean.

Las capacidades de ciberseguridad son más sensibles. Astra obtiene un 100% en ExploitBench, frente al 78,5% de GPT-5.6 Sol, y un 42,4% en ExploitGym frente al 30,3% de su antecesor cuando ambos se ejecutan sin las salvaguardas de producción. Durante una evaluación interna con vulnerabilidades recientes, el modelo llegó además a descubrir y utilizar dos fallos de día cero hasta entonces desconocidos, que OpenAI afirma estar comunicando a sus responsables.

Te puede interesar
IA Empresarial

Estas capacidades han llevado al modelo hasta el umbral «Critical» de ciberseguridad definido en el Preparedness Framework de la compañía. La versión general mantendrá restricciones sobre actividades avanzadas, como la creación de pruebas de concepto para explotar vulnerabilidades. Un grupo inicial de profesionales defensivos tendrá acceso a políticas menos restrictivas mediante el programa OpenAI Daybreak, destinado a trabajos como validación de vulnerabilidades, análisis de malware e ingeniería de detección.

Más autonomía, pero con controles adicionales

OpenAI GPT 6 Astra
OpenAI GPT 6 Astra

OpenAI presenta Astra también como su modelo más alineado hasta la fecha. En una evaluación diseñada para comprobar si un agente excedía el alcance de una tarea imposible, GPT-5.6 Sol trató de actuar fuera del objetivo autorizado en el 48,2% de los casos cuando se ejecutó sin salvaguardas de producción. Astra registró un 0%.

El resultado tiene una contrapartida. Las evaluaciones internas de OpenAI indican que el razonamiento escrito de Astra resulta más difícil de monitorizar que el de GPT-5.6 Sol. La compañía atribuye parte de esa diferencia a que el nuevo modelo puede resolver determinados problemas con menos pasos explícitos y reconoce que mejorar esa capacidad de supervisión sigue siendo una línea de investigación.

La fiabilidad al interpretar documentación también aparece en las evaluaciones de clientes. Box afirma que Astra fue más de un 10% menos propenso a realizar afirmaciones incorrectas con exceso de confianza durante sus pruebas. Yashodha Bhavnani, vicepresidenta de AI Products, destaca especialmente su criterio: «Lo que más destacó fue su criterio», y señala que el modelo evitaba extraer conclusiones que los documentos utilizados no respaldaban.

Para reducir el riesgo durante la ejecución de acciones, OpenAI incorpora sistemas adicionales de revisión y monitorización. Algunas operaciones podrán pausarse en ChatGPT o Codex para solicitar confirmación al usuario. En la API, una comprobación de seguridad que bloquee una acción detendrá directamente la tarea.

El despliegue comercial mantiene los límites de uso de las suscripciones actuales, aunque empresas y usuarios podrán adquirir créditos adicionales. Los planes Pro, Business y Enterprise recibirán además acceso a GPT-6 Astra Pro. En Enterprise, los administradores tendrán que habilitar Astra expresamente, ya que permanecerá desactivado por defecto en el lanzamiento.

En la API, el precio estándar será de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. Habrá además un modo rápido de hasta el doble de velocidad y con un precio equivalente al doble de la tarifa estándar.

Con esa estructura, la comparación para las empresas ya no dependerá únicamente del coste por token. Si Astra reduce el número de iteraciones, emplea menos tokens de salida y completa antes procesos que requieren operar con aplicaciones, su impacto económico tendrá que medirse por el coste y el tiempo necesarios para terminar una tarea completa. Esa será también la variable que determine hasta qué punto la nueva generación de modelos puede pasar de asistir al profesional a asumir partes más amplias de sus flujos de trabajo.

Ver Comentarios (0)

Leave a Reply

Utilizamos cookies para facilitar la relación de los visitantes con nuestro contenido y para permitir elaborar estadísticas sobre las visitantes que recibimos. No se utilizan cookies con fines publicitarios ni se almacena información de tipo personal. Puede gestionar las cookies desde aquí.   
Privacidad