NVIDIA presenta Cosmos 3 Edge, un modelo de mundo abierto de 4 mil millones de parámetros diseñado para que robots y agentes de visión razonen y actúen en tiempo real directamente en dispositivos de borde. ¿Por qué importa? Porque ahora puedes traer capacidad de centro de datos a sistemas con memoria limitada, desde fábricas hasta hospitales.
Qué es Cosmos 3 Edge
Cosmos 3 Edge es un modelo compacto y abierto que funciona como un vision language model (VLM) y como un world action model (WAM). Está pensado para ejecutar inferencia de alta eficiencia y alto rendimiento en hardware de borde de NVIDIA: RTX PRO, DGX, GeForce RTX y la familia Jetson (incluyendo los módulos Jetson T2000 y T3000).
Puedes descargar el modelo aquí: https://huggingface.co/nvidia/Cosmos3-Edge
Arquitectura y diseño técnico
Cosmos 3 combina dos torres tipo transformer que trabajan juntas pero con roles distintos:
- Autoregressive tower: procesa tokens de visión y texto para entender y razonar. Usa atención causal para lenguaje.
- Diffusion tower: procesa tokens de visión, audio y acción para predecir, generar y simular. Su patrón de atención es más amplio para soportar predicción coherente.
Cada torre mantiene sus propias capas de normalización y sus MLP, pero comparten capas de atención multimodal que alinean información entre texto, video, audio y acciones. Ese diseño permite primero razonar sobre la escena y luego generar salidas (tokens de razonamiento desde la torre autoregresiva o video/acción denoised desde la torre de difusión).
Acciones y representación: Cosmos 3 mapea distintas formas de describir acción (pose ego, movimiento de cámara, pose del efector final, estado del agarre) a un vector geométrico compacto que codifica:
- Translation
- Rotation
- Manipulation state
Esa representación conecta directamente control y estructura visual, de modo que los cambios en pixeles se asocian con movimiento físico y entradas de control.
Rendimiento, métricas y ejemplos relevantes
- Resolución de observación operativa:
640x360a nivel de control robótico. - Generación de acciones: hasta
32acciones por inferencia enJetson Thory control en tiempo real a15 Hz. - Benchmark: entre modelos similares de 4B parámetros, Cosmos 3 Edge ocupa el primer lugar en VANTAGE-Bench para análisis de visión y marca estado del arte en aprendizaje de políticas robóticas.
Además, NVIDIA publica una política post-entrenada llamada Cosmos 3 Edge Policy (DROID) entrenada en el dataset DROID para tareas de pick-and-place, junto con scripts de post-training.
Para afinar el modelo antes de desplegar en el borde, se recomienda usar un clúster pequeño de H100 o DGX Station para post-training eficiente. También se liberan checkpoints de referencia y recetas de entrenamiento para adaptar Cosmos 3 a cargas de trabajo específicas.
Distillation y aceleración
NVIDIA también libera el checkpoint Cosmos 3 Super 4-Step y scripts de post-training. Es una distilación que reduce el número de pasos de denoise de 35-50 a solo 4, logrando hasta 25x de aceleración en inferencia manteniendo calidad de imagen y video. Es una referencia práctica si necesitas generación de imágenes o video muy rápida en producción.
Además, hay trabajo en optimizaciones con frameworks de inferencia abierta como vLLM para reducir latencia y uso de memoria en distintos hardware.
Casos de uso y flujo práctico
Imagina un robot en una cocina: reconocer la banana es solo el inicio. Con Cosmos 3 Edge el sistema puede inferir dónde está la banana, prever cómo se moverá el efector, simular el resultado de un agarre y generar la acción para ponerla en el plato. Entrada: estado actual; Salida: acción esperada y su consecuencia visual.
Esto abre posibilidades concretas:
- Manipulación y pick-and-place en logística y manufactura.
- Agentes de visión que simulan próximas frames para control predictivo.
- Entrenamiento de políticas robustas usando datos simulados por el propio modelo.
Recomendaciones para desarrolladores
- Evalúa
Cosmos3-Edgeen tu dataset de validación para medir latencia y precisión de visión y política. - Si necesitas mejorar comportamiento en dominio específico, realiza post-training usando GPUs H100 o DGX.
- Para despliegue con baja latencia, considera distilar con
Cosmos 3 Super 4-Stepy optimizar checkpoints convLLMu otros frameworks de inferencia. - Mide siempre la frecuencia de control (Hz), consumo de memoria y tasas de éxito en la tarea física real.
- Ten en cuenta seguridad y robustez: valida acciones generadas en simulación antes de enviar comandos a hardware real.
Reflexión final
Cosmos 3 Edge acerca el modelado del mundo y la acción al dispositivo, uniendo comprensión, predicción y control en un solo modelo eficiente. No es magia: es ingeniería para que agentes físicos puedan razonar y actuar con latencia baja y menos recursos. Si trabajas en robótica o infraestructuras inteligentes, esto te da un punto de partida abierto y práctico para construir políticas y simulaciones más realistas.
