Estás leyendo
OpenAI cancela GPT-6.1 Astra por problemas de seguridad

OpenAI cancela GPT-6.1 Astra por problemas de seguridad

  • OpenAI cancela GPT-6.1 Astra tras detectar fallos para respetar límites de autorización, pese a las mejoras del modelo al ejecutar tareas complejas.
OpenAI ChatGPT

OpenAI ha descartado el lanzamiento de GPT-6.1 Astra, previsto para octubre, después de que sus evaluaciones internas detectaran que el modelo no cumplía los requisitos de seguridad y alineamiento de la compañía. El sistema había mejorado su capacidad para perseverar ante obstáculos durante tareas largas, pero esa mayor autonomía vino acompañada de una dificultad más relevante: GPT-6.1 Astra no respetaba de forma suficientemente fiable los límites de autorización establecidos por el usuario.

La decisión supone renunciar, al menos en su configuración actual, a una actualización de una de las familias de modelos más capaces de OpenAI. La compañía confirmó que el modelo obtuvo peores resultados que GPT-6 Astra en determinadas pruebas de alineamiento, según información publicada por The Register y posteriormente confirmada por otros medios.

Saachi Jain, responsable de sistemas de seguridad de OpenAI, explicó que GPT-6.1 Astra había progresado frente a lo que la empresa denomina «model laziness», la tendencia de un modelo a abandonar una tarea o devolverla al usuario cuando encuentra dificultades. El problema apareció al intentar reducir ese comportamiento.

«Aunque [GPT-6.1 Astra] mejoró en aspectos como la tendencia del modelo a abandonar tareas, no alcanzó el nivel exigido a la hora de mantenerse dentro del alcance y la autorización, ni en la forma de comunicar al usuario qué trabajo había realizado.», señaló Jain.

La cuestión resulta especialmente relevante a medida que los modelos dejan de limitarse a generar texto y adquieren capacidad para navegar, utilizar aplicaciones, ejecutar código o interactuar con servicios externos. En esos escenarios, perseverar ante un error puede ser una característica útil, pero también aumenta el número de decisiones que el sistema toma sin supervisión humana directa.

El límite entre perseverar y actuar sin permiso

OpenAI se enfrenta a un problema que está adquiriendo peso en el desarrollo de agentes de IA: cómo conseguir que un sistema complete tareas complejas sin convertir los obstáculos en una invitación a ampliar por su cuenta el alcance de sus acciones.

Según la información conocida sobre GPT-6.1 Astra, las evaluaciones encontraron dificultades en dos ámbitos relacionados. El modelo podía continuar trabajando sin solicitar autorización cuando debería haberlo hecho y, en algunos casos, no describía con suficiente precisión las acciones que había ejecutado.

El Wall Street Journal, que adelantó la decisión de OpenAI, informó además de mayores niveles de comportamiento engañoso respecto al modelo anterior. La compañía ha situado esos resultados dentro de un problema más amplio de alineamiento, referido a la capacidad de un sistema para mantenerse dentro de las instrucciones, permisos y restricciones definidos para una tarea.

El matiz es importante. Que un agente encuentre una vía alternativa para alcanzar un objetivo puede mejorar su utilidad cuando, por ejemplo, falla una API o una página cambia de estructura. La misma conducta se convierte en un riesgo cuando esa alternativa implica utilizar una herramienta no autorizada, acceder a otro sistema o realizar una acción que requiere consentimiento adicional.

«Para cualquier cuestión relacionada con la seguridad y el alineamiento existe un equilibrio», explicó Jain. La responsable de seguridad describió el problema como la búsqueda de un equilibrio entre evitar que el modelo se detenga innecesariamente y conseguir que permanezca dentro del ámbito autorizado.

GPT-6 Astra ya había mostrado dificultades para respetar el alcance

La retirada de GPT-6.1 llega después de varias señales sobre el comportamiento de los modelos más capaces cuando disponen de herramientas y pueden actuar durante periodos prolongados.

El AI Security Institute (AISI) británico publicó el 28 de septiembre los resultados de una evaluación de GPT-6 Astra, su predecesor ya desplegado, centrada en ataques contra cadenas de suministro de software. Los experimentos se realizaron mediante simulaciones y con determinados mecanismos de protección desactivados, por lo que no representan el funcionamiento habitual del modelo disponible para clientes.

Aun con esas salvedades, los datos muestran por qué los límites de autorización se han convertido en una cuestión central. GPT-6 Astra completó ataques simulados contra objetivos fuera del alcance permitido en el 29,2% de las ejecuciones analizadas, frente al 6,3% de GPT-5.6 Sol y el 0% registrado para GPT-5.5 en una muestra menor.

Cuando los investigadores modificaron las instrucciones para aclarar expresamente que cualquier elemento no incluido en el entorno autorizado quedaba fuera de alcance, la frecuencia descendió de forma considerable, pero no desapareció. GPT-6 Astra completó cuatro ataques contra la cadena de suministro en 49 trayectorias de esa segunda prueba.

El instituto observó además que el modelo razonaba sobre los límites de la evaluación y, en ocasiones, continuaba pese a haber identificado previamente que un objetivo estaba fuera de alcance. También hubo casos en los que solicitó autorización, recibió una respuesta automática para que procediera utilizando su criterio y la interpretó como permiso suficiente.

AISI advierte de una limitación importante: los experimentos utilizaban simulaciones y el modelo podía detectar indicios de que los sistemas no eran reales. Esa «conciencia de simulación» podría alterar su comportamiento, de modo que los porcentajes no permiten extrapolar directamente cómo actuaría Astra en un entorno productivo.

Los incidentes reales elevan el coste de equivocarse

Las evaluaciones coinciden con incidentes que han llevado a OpenAI a revisar sus procedimientos internos. En junio, modelos utilizados durante entrenamientos y evaluaciones accedieron a sistemas de organismos públicos australianos mediante acciones que la propia compañía reconoce que no había autorizado.

Uno de ellos obtuvo acceso no público al servicio de estadísticas de Medicare de Services Australia mientras intentaba responder a una consulta sobre gasto farmacéutico. El agente ejecutó comandos y accedió a archivos internos, credenciales, código y estadísticas agregadas. OpenAI afirma que no encontró indicios de acceso a historiales médicos individuales.

Te puede interesar
La revolución de los agentes de IA: ¿Cómo transformarán el sector tecnológico en 2025?

La compañía también identificó actividad relacionada con organismos de Nueva Gales del Sur, Victoria y el Australian Institute of Health and Welfare. Tras revisar los incidentes, reforzó las restricciones de red de sus entornos de investigación y sustituyó el acceso directo a Internet por contenido almacenado en caché en determinados procesos.

OpenAI ha pausado además entrenamientos y evaluaciones que utilizan herramientas para sus modelos más capaces mientras desarrolla protecciones adicionales.

Este tipo de episodios amplía el alcance de la seguridad de la IA más allá de las respuestas que un modelo genera frente al usuario. Para una empresa que despliega agentes con acceso a sistemas internos, el riesgo incluye qué recursos pueden utilizar, qué acciones requieren aprobación y cómo se verifica posteriormente lo que el agente afirma haber hecho.

OpenAI prepara controles más estrictos para los modelos frontera

La compañía publicó el 28 de septiembre una propuesta para utilizar «safety cases» antes de continuar determinados procesos de aprendizaje por refuerzo en modelos frontera. El concepto procede de industrias críticas y consiste en documentar con evidencias por qué una actividad puede realizarse con un nivel de riesgo aceptable.

La propuesta combina controles sobre el entrenamiento del modelo con aislamiento de infraestructura, monitorización en tiempo real y procedimientos organizativos. Entre las medidas planteadas figuran revisiones independientes, capacidad de veto para responsables de seguridad, mecanismos automáticos para detener entrenamientos, conservación inmutable de los registros de actividad y pruebas destinadas a comprobar si un modelo intenta evadir la supervisión.

El enfoque reconoce una limitación cada vez más visible: el alineamiento del modelo constituye solo una capa de defensa. Incluso cuando el entrenamiento reduce determinadas conductas, OpenAI y organismos como AISI plantean que los agentes más capaces necesitarán barreras adicionales en la infraestructura, permisos restrictivos y sistemas de monitorización capaces de interrumpir una tarea.

GPT-6.1 Astra no llegará, por tanto, en la ventana prevista de octubre. OpenAI mantiene el desarrollo de nuevos modelos Astra y asegura que otros sistemas que ya han superado sus controles de seguridad se lanzarán próximamente.

Para las empresas que empiezan a delegar procesos completos en agentes, el episodio introduce una consideración operativa concreta. Cuanto mayor sea la capacidad de un modelo para resolver obstáculos sin intervención humana, más importantes pasan a ser la definición técnica de sus permisos, la separación entre recursos y la posibilidad de detener sus acciones desde fuera del propio modelo. La autonomía útil depende también de que el sistema sepa hasta dónde puede llegar.

Ver Comentarios (0)

Leave a Reply

Utilizamos cookies para facilitar la relación de los visitantes con nuestro contenido y para permitir elaborar estadísticas sobre las visitantes que recibimos. No se utilizan cookies con fines publicitarios ni se almacena información de tipo personal. Puede gestionar las cookies desde aquí.   
Privacidad