Generar texto con un modelo de lenguaje suele parecer instantáneo, pero detrás de cada respuesta ocurre un proceso bastante metódico: el modelo produce un token, luego otro y después otro. NVIDIA quiere cambiar esa dinámica con Nemotron-Labs Diffusion, una familia de modelos que puede generar varios tokens en paralelo, revisarlos y combinarlos con la generación autoregresiva tradicional.
Del token a token a generar y refinar
Los modelos de lenguaje autoregresivos, como muchos de los que usamos a diario, escriben de izquierda a derecha. Cada token nuevo depende de los anteriores y exige una nueva pasada completa por el modelo. Este enfoque es estable, conocido y ha impulsado buena parte del progreso reciente en inteligencia artificial.
El problema aparece cuando se necesita baja latencia, se atienden consultas individuales o se intenta aprovechar mejor una GPU moderna. En esos escenarios, una parte considerable del tiempo puede gastarse moviendo pesos desde la memoria, en lugar de realizar cálculos útiles.
Además, una vez que un modelo autoregresivo genera un token, no suele poder revisarlo de forma natural. Si comete un error temprano, ese error puede influir en todo lo que escribe después. ¿Qué pasaría si el modelo pudiera redactar un bloque completo y luego corregirlo?
Los modelos de lenguaje por difusión, conocidos como DLM, siguen precisamente esa idea. Generan varios tokens en paralelo y los refinan durante varias iteraciones. Reducir el número de iteraciones permite disminuir el consumo computacional, mientras que aumentar los pasos puede favorecer una respuesta más elaborada.
Tres formas de generar con el mismo modelo
Nemotron-Labs Diffusion no obliga a elegir entre un modelo autoregresivo y uno de difusión. La misma familia admite tres modos de generación, seleccionables durante el despliegue:
- Modo autoregresivo: funciona como un modelo causal convencional, generando texto de izquierda a derecha. Sirve como referencia de corrección y mantiene la compatibilidad con los flujos de trabajo existentes.
- Modo difusión: genera bloques de tokens y los va refinando. En la implementación descrita por NVIDIA, el modelo trabaja con bloques de 32 tokens y decide cuáles están suficientemente consolidados mediante un umbral de confianza.
- Self-speculation: el modelo crea varios tokens candidatos en paralelo y después los verifica de forma autoregresiva. Así combina la velocidad de una propuesta paralela con la confiabilidad de una comprobación token por token.
Esta flexibilidad es importante para los equipos de desarrollo. Cambiar de un modo a otro no requiere rediseñar toda la aplicación, sino ajustar una opción de configuración en la etapa de inferencia. Una misma aplicación podría priorizar exactitud, velocidad o un equilibrio entre ambas según la carga de trabajo.
¿Qué ocurre con la precisión?
Acelerar la generación no sirve de mucho si la calidad cae de forma significativa. Según las evaluaciones de NVIDIA, Nemotron-Labs Diffusion 8B obtuvo una mejora promedio de 1,2 % frente a Qwen3 8B en las tareas analizadas.
En eficiencia de decodificación, NVIDIA utiliza una métrica llamada tokens por pasada hacia adelante, o TPF. A diferencia de una medición atada a un hardware concreto, esta métrica busca mostrar cuántos tokens procesa el modelo en cada ejecución del cálculo.
Los resultados publicados indican que:
- El modo difusión alcanzó hasta 2,6 veces más TPF que los modelos autoregresivos comparados.
- La self-speculation llegó a 6 veces más TPF con especulación lineal.
- La especulación cuadrática alcanzó 6,4 veces más TPF.
- En una prueba con una GPU NVIDIA B200, LinearSpec logró cerca de 865 tokens por segundo, aproximadamente cuatro veces el rendimiento autoregresivo de referencia en el mismo hardware.
Estas cifras deben leerse como resultados de las pruebas de NVIDIA, no como una garantía universal. El rendimiento final dependerá del hardware, la longitud del contexto, el tamaño del lote, la configuración de inferencia y la tarea concreta.
La arquitectura combina pasado autoregresivo y difusión
Los modelos de difusión para texto han enfrentado varios obstáculos: menor precisión que los mejores modelos autoregresivos, entrenamiento más complejo y compatibilidad limitada con las cachés de atención, conocidas como KV cache.
La KV cache almacena parte de los cálculos ya realizados para evitar repetirlos durante la generación. Es una pieza fundamental para acelerar la inferencia autoregresiva, por lo que cualquier alternativa que no pueda aprovecharla parte con una desventaja práctica.
Nemotron-Labs Diffusion adopta una estrategia híbrida. NVIDIA parte de un modelo autoregresivo y le añade capacidades de difusión mediante entrenamiento adicional. El objetivo es conservar las habilidades aprendidas durante el entrenamiento original y, al mismo tiempo, permitir la generación paralela por bloques.
El entrenamiento utilizó un objetivo conjunto autoregresivo y de difusión. La fase de preentrenamiento empleó 1,3 billones de tokens de los conjuntos de datos de preentrenamiento de NVIDIA Nemotron. Después, el modelo recibió ajuste supervisado con otros 45.000 millones de tokens de los conjuntos de postentrenamiento de la compañía.
No se trata, por tanto, de abandonar por completo la generación tradicional. La propuesta es convertir ambos enfoques en capacidades disponibles dentro del mismo modelo, como si el desarrollador pudiera elegir entre una transmisión estable, una redacción paralela o una combinación de las dos.
Modelos disponibles y posibilidades para desarrolladores
La familia incluye modelos de texto de 3.000 millones, 8.000 millones y 14.000 millones de parámetros, además de un modelo de lenguaje y visión de 8.000 millones de parámetros. NVIDIA ofrece variantes base y versiones ajustadas para seguir instrucciones y conversar.
Los modelos de texto se publican bajo la NVIDIA Nemotron Open Model License, orientada a facilitar su uso comercial. El modelo de visión y lenguaje utiliza la NVIDIA Source Code License, que NVIDIA presenta como una opción con amplia flexibilidad para investigación. Antes de integrar cualquiera de ellos en un producto, conviene revisar las condiciones exactas de cada licencia.
NVIDIA también libera el código de entrenamiento mediante el framework Megatron Bridge. La integración con SGLang está prevista para su rama principal, mientras que el soporte de inferencia se encuentra disponible inicialmente a través de una solicitud en el repositorio del proyecto.
En la práctica, la configuración puede definir si el modelo trabaja en modo autoregresivo, difusión o self-speculation. En el modo autoregresivo se puede activar ar_mode=true. Para los otros modos, NVIDIA menciona implementaciones como FastDiffuser y LinearSpec, enfocadas respectivamente en el rendimiento de difusión y en la verificación especulativa.
Por qué esta propuesta importa
La generación paralela puede ser especialmente útil en asistentes de programación, edición de documentos, autocompletado, traducción y aplicaciones donde una respuesta rápida tiene impacto directo en la experiencia. También puede ayudar en tareas de relleno en el centro de un texto, porque el modelo no está limitado a completar únicamente desde el último token.
La capacidad de revisar tokens introduce otra diferencia importante. Un modelo autoregresivo tradicional escribe como alguien que no puede borrar lo que acaba de poner en la página. Un modelo de difusión puede hacer un borrador, detectar qué partes tienen menor confianza y refinarlas antes de fijar el resultado.
La apuesta de Nemotron-Labs Diffusion no es reemplazar la generación autoregresiva en todos los casos, sino ofrecer una misma base con distintos modos de velocidad, revisión y verificación.
Para los desarrolladores, esa compatibilidad puede ser más importante que una promesa abstracta de velocidad. Si el mismo checkpoint funciona como modelo autoregresivo, modelo de difusión y sistema de self-speculation, experimentar con el rendimiento requiere menos cambios en la aplicación y en la infraestructura.
Nemotron-Labs Diffusion muestra hacia dónde puede avanzar la inferencia de lenguaje: modelos capaces de redactar en paralelo, corregir partes de su salida y recurrir a la generación autoregresiva cuando la precisión lo exige. La idea de una generación a la velocidad de la luz sigue siendo una metáfora, pero reducir el tiempo que una GPU pasa esperando memoria es un objetivo muy concreto.
