Multiverse Computing ha reducido de 31.600 a 16.150 millones de parámetros un modelo de razonamiento basado en NVIDIA Nemotron, una compresión dirigida a ejecutar cargas avanzadas de inteligencia artificial con menos memoria y una infraestructura más contenida. El resultado, denominado Pulsar 16B, mantiene 3.100 millones de parámetros activos frente a los 3.500 millones del modelo de partida y abre una vía para organizaciones que necesitan desplegar IA en sus propios sistemas por coste, latencia, regulación o soberanía del dato.
La empresa sostiene que el modelo conserva un rendimiento próximo al original en razonamiento, programación, seguimiento de instrucciones, uso de herramientas y procesamiento de contextos largos. Esa combinación resulta relevante para asistentes empresariales, flujos agénticos con numerosas peticiones simultáneas y análisis continuo de documentos, aunque el comportamiento real dependerá de la carga de trabajo, la precisión elegida y el hardware utilizado.
Compresión sin entrenar otro modelo desde cero
La compresión de Pulsar 16B parte de NVIDIA-Nemotron-3-Nano-30B-A3B-BF16, un modelo con arquitectura híbrida Mamba2-Transformer y Mixture-of-Experts. Multiverse Computing aplicó su tecnología CompactifAI e integró las bibliotecas NVIDIA Model Optimizer y Megatron Bridge en el proceso. La reducción se realizó sobre la red ya entrenada, sin repetir desde cero esa fase, mediante la identificación y eliminación de redundancia matemática.
El modelo comprimido conserva la familia arquitectónica, el formato de las instrucciones, la estructura de llamadas a herramientas y la interfaz de razonamiento de Nemotron. Esto puede reducir el trabajo de adaptación para equipos que ya operan con ese entorno, si bien una reducción en el número de parámetros no permite por sí sola calcular el ahorro final: la memoria, el consumo y el coste también dependen de la precisión, la concurrencia y la configuración de inferencia.
Pulsar 16B se distribuye en precisiones BF16, FP8 y NVFP4 y puede descargarse desde Hugging Face bajo licencia Apache 2.0. La disponibilidad de distintos formatos permite ajustar el despliegue al hardware y al equilibrio buscado entre recursos y calidad, desde servidores con GPU hasta entornos de nodo único. La propuesta se dirige especialmente a sistemas locales, aislados o sensibles a la latencia, donde recurrir continuamente a infraestructura cloud puede resultar inadecuado.
Enrique Lizaso, cofundador y consejero delegado de Multiverse Computing, vincula la reducción de tamaño con esa posibilidad de despliegue empresarial: «Lo que demostramos con Pulsar 16B es que el razonamiento de nivel frontera puede desplegarse ahora sin la infraestructura propia de la escala cloud, con una huella que las empresas pueden ejecutar y escalar de forma económica.»
Más velocidad de inferencia en la prueba con Blackwell
La principal medición operativa aportada se realizó con 32 solicitudes concurrentes sobre una GPU NVIDIA Blackwell. En esa configuración, Pulsar 16B en FP8 procesó 4.808 tokens por segundo, frente a los 3.363 del modelo base, una mejora del 43%. El tiempo hasta el primer token descendió de 2,18 a 1,24 segundos. Son resultados relevantes para servicios interactivos y cargas concurrentes, pero corresponden a un escenario concreto y no anticipan automáticamente el rendimiento sobre otro hardware.
En las evaluaciones académicas, Pulsar 16B obtuvo 87,22 puntos en AIME 2025, frente a los 87,66 del modelo Nemotron sin comprimir. En GPQA-Diamond alcanzó 71,41 y quedó cerca del modelo de partida. Multiverse Computing también declara resultados próximos al original en seguimiento de instrucciones y llamadas a funciones, dos capacidades importantes cuando el modelo debe operar herramientas o ejecutar pasos dentro de un proceso empresarial.
Las comparaciones con gpt-oss-20B exigen mayor precisión. Las cifras difundidas inicialmente atribuían al rival alrededor de 72 puntos en AIME y 58,88 en GPQA-Diamond. Sin embargo, la ficha técnica actual de Pulsar 16B FP8 en Hugging Face recoge 87,66 y 68,99, respectivamente, para gpt-oss-20B. La diferencia desaparece en AIME y se reduce en GPQA, por lo que cualquier comparación requiere comprobar la versión, la configuración y la metodología empleadas.
Contextos largos y despliegues soberanos
La compañía evaluó además el comportamiento con documentos extensos mediante LongBench, AA-LCR, RULER y variantes de needle-in-a-haystack con longitudes superiores a 100.000 tokens. Según sus pruebas, el modelo mantuvo una recuperación prácticamente perfecta alrededor de ese umbral y siguió de cerca al Nemotron original en las tareas más exigentes de RULER. Estas mediciones son especialmente pertinentes para expedientes, bases documentales y procesos en los que perder información alejada dentro del contexto puede invalidar el resultado.
La orientación hacia instalaciones controladas por el cliente ha ganado peso tras el lanzamiento. En septiembre de 2026, Multiverse Computing y Zylon acordaron integrar modelos comprimidos en una plataforma local y aislada de Internet para bancos, defensa y administraciones públicas. Ese acuerdo conecta la reducción del modelo con entornos donde la ubicación de los datos, la seguridad y el control de la infraestructura condicionan la adopción de IA.
La propia Multiverse Computing lanzó también Luminary, una plataforma para comparar modelos mediante conversaciones completas, coste por tarea terminada, latencia, éxito y cumplimiento de políticas. Ese tipo de evaluación amplía la información ofrecida por los benchmarks académicos y permite determinar si la ventaja de un modelo comprimido se mantiene al integrarlo en procesos reales.
Para una empresa, la decisión operativa pasa por probar Pulsar 16B con sus propios documentos, herramientas, niveles de concurrencia y requisitos de calidad. La reducción de parámetros y la mejora observada sobre Blackwell justifican ese piloto, especialmente en instalaciones locales, pero la adopción debería apoyarse en métricas de coste por tarea, latencia, precisión y cumplimiento antes de sustituir un modelo mayor o trasladar cargas desde la nube.
