Estás leyendo
Red Hat AI 3.5 añade controles para operar modelos y agentes a escala

Red Hat AI 3.5 añade controles para operar modelos y agentes a escala

  • La actualización incorpora evaluación previa al despliegue, atribución de costes, gestión de GPU y aislamiento multinquilino para cargas de inteligencia artificial en la nube híbrida.
Agentes de IA

Red Hat ha concentrado en Red Hat AI 3.5 controles de seguridad, observabilidad y gestión de recursos destinados a que las empresas operen modelos y agentes de inteligencia artificial como una infraestructura compartida. La actualización aborda una dificultad que aparece al superar la fase piloto: mantener bajo control los riesgos, los costes y el rendimiento cuando varias áreas, aplicaciones o clientes utilizan los mismos recursos de computación.

La nueva versión incorpora evaluación antes del despliegue, métricas sobre inferencia y consumo, asignación de capacidad de GPU y mecanismos de aislamiento entre inquilinos. También amplía las herramientas para desarrollar agentes conectados a datos empresariales. Red Hat AI 3.5 está disponible de forma general desde el 16 de septiembre de 2026 y forma parte asimismo de Red Hat AI Factory with NVIDIA.

Evaluar los riesgos antes de poner los modelos en producción

Uno de los componentes centrales es EvalHub, ya disponible de forma general. La herramienta automatiza informes auditables de seguridad y cumplimiento para modelos personalizados, sistemas de generación aumentada por recuperación, conocidos como RAG, y agentes. El objetivo es que los equipos puedan comparar el comportamiento de estos sistemas y documentar sus riesgos antes de incorporarlos a una aplicación empresarial.

El catálogo incluye además más de 20 nuevos modelos validados, con opciones de Google, NVIDIA y Alibaba Cloud, entre otros proveedores. Los modelos evaluados incorporan referencias de seguridad integradas con Garak, además de puntuaciones relacionadas con exposición de datos personales y riesgo de toxicidad. Un grupo seleccionado aparece también identificado como verificado para llamadas a herramientas, una función relevante cuando un agente puede ejecutar acciones sobre otros sistemas.

Para las conversaciones agénticas de varios turnos, Red Hat ha llevado a disponibilidad general el soporte para Responses API y RAG integrado. La interfaz se combina con NeMo Guardrails, que intercepta llamadas maliciosas a herramientas. Estas funciones aportan controles específicos sobre el comportamiento de los agentes, aunque su eficacia operativa dependerá de las políticas, configuraciones y evaluaciones que aplique cada organización.

Joe Fernandes, vicepresidente y director general de la unidad de negocio de IA de Red Hat, sitúa estas incorporaciones dentro de un cambio en las prioridades de los departamentos tecnológicos: «La conversación ha pasado de llevar la IA a producción a ejecutarla a escala como una infraestructura empresarial de confianza, lo que requiere evidencias de seguridad, agentes gobernados, atribución de costes y soporte multinquilino».

Visibilidad sobre tokens, modelos y capacidad de GPU

La observabilidad ocupa otro bloque relevante de Red Hat AI 3.5. Los nuevos paneles muestran el estado de la inferencia, el rendimiento de modelos y agentes y la utilización de las GPU. La plataforma también mide el consumo de tokens por usuario, de modo que los responsables puedan atribuir internamente los costes de los servicios de modelos a los equipos o cargas de trabajo que los generan.

Esta trazabilidad responde a un problema distinto del rendimiento técnico. Cuando una capacidad de IA se ofrece como servicio común dentro de una organización, el departamento de plataforma necesita conocer quién consume los recursos y con qué intensidad. La medición por usuario proporciona una base para distribuir costes, establecer límites y detectar cargas que concentran una parte desproporcionada de la infraestructura disponible.

La gestión de GPU añade planificación equitativa entre inquilinos y un servicio orientado a prioridades. Este último combina control de admisión y enrutamiento de peticiones para proteger las solicitudes de inferencia en tiempo real, mientras permite que los trabajos en segundo plano utilicen la capacidad libre. El despliegue controlado de modelos gestiona a su vez el tráfico durante las actualizaciones para reducir las interrupciones del servicio.

Inference-Time Scaling ajusta dinámicamente la computación según la dificultad de cada consulta, con la finalidad de evitar que todas las peticiones reciban el mismo nivel de recursos. La disponibilidad general de la descarga a CPU permite además gestionar conversaciones más largas y documentos de mayor tamaño sin añadir hardware de GPU. La descarga a almacenamiento permanece en vista previa para desarrolladores.

Aislamiento para una infraestructura compartida

El soporte multinquilino se refuerza mediante planos de control alojados de Red Hat OpenShift desplegados sobre OpenShift Virtualization. Cada inquilino puede disponer de un plano de control de clúster dedicado, mientras el proveedor consolida el hardware subyacente. Las cargas de IA ejecutadas en máquinas virtuales añaden aislamiento a nivel de máquina virtual sobre servidores físicos compartidos y con capacidad para GPU.

Te puede interesar
Guilherme Reis, director general para Iberia, Digital Realty

Esta arquitectura está dirigida tanto a proveedores de servicios de IA como a organizaciones que ofrecen capacidad de modelos a varias unidades internas. El operador puede administrar y actualizar el entorno subyacente desde un único punto de control, al tiempo que separa los recursos asignados a cada inquilino. Los paneles muestran el inventario de hardware, la utilización activa y el préstamo dinámico de capacidad de GPU.

La inferencia distribuida mediante llm-d se extiende también fuera de OpenShift hacia servicios Kubernetes de terceros. Está disponible de forma general en CoreWeave CKS y Microsoft Azure, mientras que Amazon EKS se incorpora como vista previa tecnológica. Con ello, Red Hat pretende mantener una experiencia uniforme de servicio de modelos entre diferentes infraestructuras de nube.

Agentes conectados a los datos empresariales

En el desarrollo agéntico, AutoRAG conecta repositorios de datos empresariales con aplicaciones y añade soporte para documentos multilingües, pruebas conversacionales y recuperación contextual. Un pipeline visual permite comprobar las configuraciones RAG antes del despliegue. La compatibilidad con pgvector y AutoML nativo amplía las opciones para preparar la recuperación de información y adaptar los modelos a cada consulta.

AI Hub incorpora plantillas y kits de inicio para revisión de código, procesamiento de documentos y flujos de investigación. Estas implementaciones reúnen marcos de trabajo, herramientas y configuraciones de despliegue, y pueden ejecutarse en entornos aislados manteniendo los controles operativos y las políticas de seguridad definidos por la organización.

Para los equipos de plataforma, el efecto práctico es disponer de un mismo entorno para condicionar el acceso a los modelos, priorizar peticiones, separar usuarios, medir el gasto y revisar riesgos antes del despliegue. Esa combinación permite tratar la capacidad de IA como un servicio interno con reglas operativas explícitas, en lugar de gestionar cada proyecto con herramientas y procesos separados.

Ver Comentarios (0)

Leave a Reply

Utilizamos cookies para facilitar la relación de los visitantes con nuestro contenido y para permitir elaborar estadísticas sobre las visitantes que recibimos. No se utilizan cookies con fines publicitarios ni se almacena información de tipo personal. Puede gestionar las cookies desde aquí.   
Privacidad