Estás leyendo
OpenAI acelera GPT-5.6 Sol hasta 14 veces con Ultrafast

OpenAI acelera GPT-5.6 Sol hasta 14 veces con Ultrafast

  • OpenAI prueba GPT-5.6 Sol Ultrafast en su API, con hasta 750 tokens por segundo y acceso limitado para procesos empresariales sensibles a la latencia.
OpenAi GPT-5.6 Luna

OpenAI ha abierto una vista previa limitada de GPT-5.6 Sol Ultrafast, un nuevo nivel de servicio para su API capaz de ejecutar su modelo de mayor capacidad hasta 14 veces más rápido que el procesamiento Standard. La compañía sitúa el máximo en 750 tokens de salida por segundo y ha recurrido a Cerebras para la infraestructura de inferencia. La cifra importa menos como récord aislado que por el tipo de carga que intenta desbloquear: procesos donde varios segundos de espera pueden alterar una decisión, interrumpir una conversación o retrasar la respuesta ante una incidencia.

GPT-5.6 Sol Ultrafast lleva la baja latencia al modelo principal

Ultrafast llega poco más de un mes después de que OpenAI pusiera la familia GPT-5.6 a disposición de ChatGPT, Codex y la API, el 9 de julio. Sol ocupa el nivel superior de capacidad, mientras Terra y Luna cubren posiciones de menor coste o mayor velocidad. La nueva modalidad conserva GPT-5.6 Sol y cambia la infraestructura y el nivel de servicio con el que se ejecuta, llevando una configuración de máxima capacidad a cargas donde el tiempo de respuesta forma parte del rendimiento de la aplicación.

OpenAI afirma que GPT-5.6 Sol puede alcanzar con Ultrafast hasta 750 tokens de salida por segundo, frente a una ejecución hasta 14 veces más lenta en Standard. El dato describe el máximo de generación, no necesariamente el tiempo total de una tarea. En aplicaciones con herramientas, búsquedas, llamadas a bases de datos o cadenas de razonamiento, la latencia final depende también de cada sistema conectado y del número de pasos que el agente necesita completar. La diferencia entre velocidad de inferencia y duración del flujo completo será especialmente relevante al trasladar las pruebas a producción.

Ese matiz gana peso porque la API ya dispone de Fast mode. Desde finales de julio, OpenAI ofrece esa modalidad con hasta 2,5 veces la velocidad de Standard para GPT-5.6 Sol y un precio equivalente al doble de la tarifa normal. Ultrafast queda, durante esta fase previa, por encima de esa categoría. El anuncio y el registro de cambios de la API no detallan todavía una tarifa específica para el nuevo nivel, y el acceso se limita a clientes seleccionados según el encaje de la carga y la capacidad disponible.

Cerebras cambia dónde se produce el cuello de botella

La diferencia técnica está en el hardware. Cerebras ejecuta Ultrafast sobre su arquitectura Wafer-Scale Engine, diseñada alrededor de chips de tamaño oblea con una gran cantidad de memoria SRAM integrada. Su planteamiento reduce el movimiento continuo de los pesos del modelo entre memoria externa y unidades de cálculo, uno de los límites que la compañía identifica durante la inferencia de modelos grandes.

Cerebras sostiene que cada chip incorpora 44 GB de SRAM y que los pesos permanecen cerca del cómputo mientras los tokens atraviesan las capas del modelo mediante una canalización entre obleas. La comparación con una GPU convencional simplifica arquitecturas que pueden variar mucho entre proveedores, aunque ayuda a explicar la prioridad del diseño: reducir el tiempo dedicado al movimiento de datos cuando la generación debe sostener cientos de tokens por segundo.

Para OpenAI, la integración añade otra vía para servir su modelo principal con una latencia mucho menor. Para Cerebras supone una referencia relevante en inferencia de modelos frontera: su infraestructura pasa a respaldar GPT-5.6 Sol dentro de un servicio que OpenAI presenta directamente a clientes de su API. La capacidad, sin embargo, continúa siendo un factor visible. Ambas compañías mantienen Ultrafast en acceso restringido y vinculan su expansión al aumento de recursos disponibles.

De los tokens por segundo al tiempo de negocio

Los primeros casos de uso elegidos explican mejor la propuesta que la cifra bruta de velocidad. OpenAI cita respuesta a incidentes, investigación financiera, seguridad, atención al cliente, voz, comercio y experimentación. Todos comparten una característica operativa: el valor de la respuesta puede reducirse rápidamente cuando el sistema tarda demasiado en producirla.

Durante una caída de servicio, por ejemplo, un agente puede leer registros, revisar trazas, relacionar cambios recientes de código y sintetizar conversaciones técnicas mientras la incidencia continúa. OpenAI señala que sus propios desarrolladores han utilizado Ultrafast para acelerar esa secuencia y preparar o validar posibles correcciones, manteniendo la decisión final y el despliegue bajo responsabilidad de los ingenieros.

En atención al cliente o voz, el criterio cambia. Un sistema que necesita consultar varias herramientas puede producir una respuesta adecuada y, aun así, introducir una espera difícil de encajar en una conversación. En comercio aparece un problema parecido: comprobar inventario, recuperar datos de producto, adaptar una recomendación y resolver una incidencia de pago mientras el comprador sigue en la sesión exige que la cadena completa mantenga un ritmo compatible con la interacción en tiempo real. Son precisamente algunas de las cargas para las que OpenAI está solicitando candidatos durante la vista previa.

Te puede interesar
Agentes de IA

La investigación interna ofrece otro patrón. OpenAI describe trabajos que antes se ejecutaban por lotes durante la noche y que, con una inferencia más rápida, pueden convertirse en varias iteraciones dentro de la jornada. La ganancia potencial aparece entonces en el número de ciclos de prueba, revisión y ajuste que caben en una misma sesión, aunque esa mejora dependerá de cuánto tiempo de la tarea corresponda realmente al modelo y cuánto permanezca condicionado por herramientas externas.

GPT-5.6 Sol Ultrafast afronta la prueba de producción

Cerebras ha publicado resultados propios para medir esa diferencia. En Humanity’s Last Exam, asegura que GPT-5.6 Sol Ultrafast completó 2.500 preguntas en 11 horas y 11 minutos, frente a 78 horas y 27 minutos para Claude Fable 5 con una precisión comparable. En GDP-Val, su evaluación atribuye a Ultrafast una aceleración de 5,6 veces de extremo a extremo frente a GPT-5.6 Sol Standard sin pérdida de calidad.

Son referencias útiles para dimensionar el efecto, pero proceden del proveedor que suministra la infraestructura y se realizaron con configuraciones concretas. Cerebras especifica, por ejemplo, distintos niveles de razonamiento y entornos de ejecución para sus comparaciones. El comportamiento de una aplicación empresarial dependerá de la longitud de las respuestas, las herramientas externas, el contexto enviado y las esperas de red. También queda pendiente conocer el precio público de Ultrafast, una variable esencial para calcular si reducir segundos compensa en cargas de gran volumen.

Jane Street, Podium, Basis y Rogo figuran entre las compañías que han participado en las primeras pruebas, dentro de aplicaciones relacionadas con programación, comercio, investigación financiera y soporte. OpenAI quiere utilizar esta fase para observar dónde un cambio de orden de magnitud en velocidad modifica realmente el producto y ampliará el servicio conforme aumente la capacidad. A 14 de agosto de 2026, no ha comunicado una fecha de disponibilidad general.

Para los equipos de tecnología, la vista previa deja una decisión más granular que la elección de modelo. Standard puede encajar en trabajos paralelos o asíncronos; Fast ofrece una aceleración intermedia con una prima conocida; Ultrafast apunta a rutas críticas donde una respuesta tardía tiene un coste operativo medible. El dato de 750 tokens por segundo será relevante solo en la medida en que reduzca el ciclo completo de esas tareas. Hasta que OpenAI publique precio, capacidad y condiciones generales, esa cuenta seguirá dependiendo de cada proceso y del valor económico de los segundos que consiga eliminar.

Ver Comentarios (0)

Leave a Reply

Utilizamos cookies para facilitar la relación de los visitantes con nuestro contenido y para permitir elaborar estadísticas sobre las visitantes que recibimos. No se utilizan cookies con fines publicitarios ni se almacena información de tipo personal. Puede gestionar las cookies desde aquí.   
Privacidad