Editor en La Ecuación Digital. Analista y divulgador tecnológico con…
Google ha presentado Gemini 4 Argon, su nuevo modelo de inteligencia artificial de mayor capacidad, con mejoras centradas en ingeniería de software, ciberseguridad y tareas profesionales complejas. La compañía ha optado, sin embargo, por un lanzamiento distinto al de otros modelos de Gemini: Argon empieza a distribuirse entre un grupo limitado de especialistas en seguridad antes de llegar a desarrolladores, empresas y consumidores.
El despliegue inicial se realizará a través de Fairwind, el programa de Google para colaboradores de ciberseguridad considerados de confianza. Al mismo tiempo, la empresa está participando en el proceso voluntario del Gobierno de Estados Unidos para evaluar modelos avanzados antes de su lanzamiento general. Google no ha fijado todavía una fecha concreta para ampliar el acceso.
La decisión refleja una de las características que diferencian a Argon dentro de la familia Gemini: Google lo ha entrenado específicamente para realizar trabajo defensivo de ciberseguridad, incluido el análisis autónomo de software para localizar, validar y corregir vulnerabilidades críticas. Ese nivel de capacidad también aumenta las posibilidades de uso indebido, lo que explica que la compañía esté probando sus mecanismos de protección antes de distribuir el modelo de forma más amplia.
Un modelo pensado para tareas largas y complejas
Gemini 4 Argon está diseñado para mantener procesos de razonamiento prolongados y ejecutar flujos de trabajo formados por múltiples pasos. Una de las modificaciones técnicas más relevantes es el aumento de su límite de salida hasta un millón de tokens, frente a los 64.000 anteriores, una ampliación orientada a tareas que requieren producir o procesar grandes cantidades de información dentro de una misma ejecución.
Google ya utiliza el modelo internamente. Miles de empleados lo han probado para programación especializada, investigación, depuración de código y migraciones de grandes bases de software. La compañía asegura que Argon alcanza un 77,9% en DeepSWE v1.1, una evaluación destinada a medir el rendimiento en tareas de ingeniería de software de larga duración y cercanas al trabajo real.
Uno de los proyectos internos más ambiciosos consiste en utilizar agentes basados en Argon para migrar código escrito en C y C++ a Rust. Las pruebas abarcan desde bibliotecas con decenas de miles de líneas hasta más de 800.000 líneas del kernel Zircon de Fuchsia. Google señala que estas migraciones están sometidas a revisiones humanas, pruebas automatizadas y emulación antes de incorporarse a sistemas de producción.
El modelo también se ha empleado para optimizar infraestructura física. Agentes de Argon analizaron datos de rendimiento de los centros de datos de Google e identificaron cambios destinados a reducir el consumo de memoria. Tras aplicar parte de esas modificaciones, la empresa afirma haber liberado más de 300 TiB y calcula que el ahorro total podría situarse entre 500 TiB y 1 PiB.
La experiencia ofrece una referencia sobre una de las aplicaciones empresariales que los proveedores de modelos avanzados intentan consolidar: sistemas capaces de intervenir sobre procesos técnicos extensos, analizar grandes volúmenes de telemetría y proponer cambios operativos, en lugar de limitarse a generar código o responder consultas individuales.
Ciberseguridad antes que un lanzamiento general
La seguridad informática ocupa una posición especialmente relevante en Argon. Google sostiene que el modelo puede buscar vulnerabilidades, comprobar si son explotables y generar correcciones. En CWE-bench v1, una prueba centrada en la reparación de vulnerabilidades de software, obtuvo un 68%, resultado que lo sitúa empatado en primera posición dentro de la evaluación presentada por la compañía.
Las pruebas internas también muestran una mejora respecto a 3.8 Flash Cyber, el modelo especializado en seguridad que Google lanzó previamente. En evaluaciones realizadas por Wiz sobre sistemas web sin acceso al código fuente, Argon obtuvo mejores resultados al identificar superficies de ataque, encontrar vulnerabilidades y generar pruebas de concepto para verificarlas, según los datos publicados por Google.
Ese rendimiento explica parte de la cautela del despliegue. Antes de abrir el modelo, la empresa está trabajando sobre cuatro áreas de protección: prevención de usos maliciosos, resistencia frente a ataques de «prompt injection», detección de comportamientos que se alejen de las instrucciones del usuario y aislamiento de los entornos donde se ejecutan las evaluaciones más sensibles.
Google prevé proporcionar a determinados equipos defensivos una versión sin algunas de las restricciones de ciberseguridad aplicadas al uso general. El objetivo es que puedan aprovechar íntegramente las capacidades del modelo para analizar sistemas y vulnerabilidades, mientras el acceso ordinario conservará barreras destinadas a impedir aplicaciones ofensivas.
El lanzamiento coincide además con una iniciativa voluntaria de seguridad impulsada desde la Casa Blanca. El 29 de septiembre, el presidente estadounidense Donald Trump y responsables de varias grandes tecnológicas firmaron un documento sobre desarrollo y despliegue responsable de inteligencia artificial descrito como «moralmente vinculante», aunque no como una obligación legal.
Google vuelve a competir en la frontera de los modelos
Argon llega después de varios cambios en la hoja de ruta de Gemini. Google ha descartado el lanzamiento de Gemini 3.5 Pro, que Sundar Pichai había anticipado inicialmente para junio, y ha pasado directamente a la nueva generación. Reuters señala además que el desarrollo se produjo después de meses de retrasos mientras OpenAI y Anthropic continuaban presentando nuevos modelos avanzados.
Las comparaciones publicadas por Google sitúan a Argon al nivel de algunos de los modelos de mayor capacidad de sus competidores, aunque los resultados varían entre pruebas. La empresa afirma que lidera evaluaciones relacionadas con trabajo financiero, jurídico y empresarial y que empata con otros modelos avanzados en determinadas pruebas de ciberseguridad. Reuters advierte, al mismo tiempo, de que Argon queda por detrás de sus rivales en dos de los cuatro benchmarks de programación incluidos por la propia Google en su presentación.
Esta disparidad resulta relevante porque los benchmarks continúan ofreciendo una visión parcial del comportamiento de los sistemas. Argon encabeza, según Google, el Vals Index, que combina evaluaciones de finanzas, programación, derecho y fiscalidad, y alcanza un 51,3% en AutomationBench, una prueba de Zapier destinada a medir la ejecución integral de procesos empresariales. Son indicadores útiles para comparar capacidades concretas, pero no equivalen por sí solos al rendimiento que una organización obtendrá al integrar el modelo en procesos reales.
Google ha añadido otro componente a su propuesta empresarial: el precio. Cuando amplíe su disponibilidad, Argon tendrá inicialmente un coste de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida, mientras que las entradas almacenadas en caché tendrán un descuento del 95%.
La combinación de ventanas de trabajo mucho más extensas, ejecución mediante agentes y precios por consumo desplaza parte de la competencia hacia una cuestión operativa. Para las empresas que estudien utilizar Gemini 4 Argon, el rendimiento de un benchmark será solo una variable junto al coste de ejecutar procesos largos, la supervisión necesaria, la integración con sus sistemas y los controles que Google termine imponiendo cuando el modelo salga del entorno restringido de ciberseguridad.
Editor en La Ecuación Digital. Analista y divulgador tecnológico con más de 30 años de experiencia en el estudio del impacto de la tecnología en la empresa y la economía.
