Google presentó Gemini Omni 1.1 Flash, una actualización que busca hacer más controlable, rápida y útil la generación de video con inteligencia artificial. La nueva versión está dirigida a desarrolladores que crean herramientas creativas, flujos de producción audiovisual y aplicaciones de edición.
La propuesta no se limita a generar un clip a partir de una descripción. Ahora permite continuar escenas, definir fotogramas clave, usar videos como referencia y producir versiones preliminares con menor costo. ¿El objetivo? Que la IA se parezca más a una herramienta de producción y menos a una caja negra que entrega resultados difíciles de ajustar.
Extender escenas para contar historias más largas
Una de las principales novedades es la función de extensión de escenas. A partir de un video existente, Gemini Omni 1.1 Flash puede continuar la acción desde el punto donde terminó, manteniendo mejor la apariencia de los personajes, el entorno y la lógica narrativa.
El modelo puede analizar hasta 10 segundos de contexto previo, frente al último segundo que utilizaban versiones anteriores. Esto ayuda a conservar movimientos, iluminación y continuidad visual durante la generación.
Las escenas pueden extenderse en bloques de 10 segundos hasta alcanzar una duración acumulada de 40 segundos. Para un creador, esto significa que puede construir una secuencia más larga sin tener que generar cada fragmento desde cero ni corregir constantemente los saltos visuales.
Controlar el inicio y el final de cada toma
Omni 1.1 Flash también permite especificar el primer y el último fotograma de una toma. El modelo genera la transición entre ambos puntos, una función útil para planificar movimientos de cámara, acercamientos, giros y bucles continuos.
Por ejemplo, puedes indicar que una cámara comience con un baterista en primer plano y termine revelando a un saxofonista junto a una bailarina. También puedes pedir que la cámara se acerque a una pantalla de televisión y conecte con la escena inicial sin cortes visibles.
Este tipo de control resulta especialmente valioso cuando la generación de video forma parte de un proceso profesional. En lugar de depender únicamente de una instrucción extensa, el creador puede establecer puntos visuales concretos y dejar que la IA complete el recorrido entre ellos.
Videos preliminares en 360p para iterar más rápido
La nueva versión incorpora generación en resolución de 360p para crear borradores con mayor velocidad. Según Google, estos videos pueden generarse hasta un 60 % más rápido y con aproximadamente un tercio del costo de una salida estándar en 720p.
La resolución es suficiente para probar ideas, revisar un storyboard o comparar distintas instrucciones antes de producir el resultado final. Así puedes experimentar con una escena microscópica, una animación o un movimiento de cámara sin gastar recursos en cada intento de alta calidad.
La lógica es sencilla: primero validas la idea con un borrador liviano y después inviertes en la versión definitiva. ¿Por qué renderizar en alta resolución algo que todavía no sabes si funciona?
Salidas profesionales de hasta 4K
Cuando el concepto está listo, Gemini Omni 1.1 Flash puede generar videos en 1080p o escalar los resultados hasta 4K para usos de producción profesional.
Google muestra ejemplos que incluyen peces captados en movimiento, un pequeño animal atravesando un bosque y primeros planos cinematográficos de hojas de arce iluminadas por el sol. La intención es ofrecer mayor detalle, texturas más definidas y una apariencia adecuada para piezas audiovisuales terminadas.
La disponibilidad de estas resoluciones no elimina la necesidad de revisar el resultado. La consistencia de manos, rostros, objetos y movimientos todavía debe evaluarse en cada proyecto, especialmente cuando el video será utilizado en publicidad, entretenimiento o comunicación corporativa.
Usar videos de referencia para mantener personajes y movimientos
Otra función permite incluir hasta tres segundos de video como referencia dentro de una entrada multimodal. De esta forma, el modelo puede usar movimientos, estilos de baile y contexto visual para crear una nueva escena.
En uno de los ejemplos de Google, varios videos de bailarines sirven como guía para animar a un perro, un pulpo y un oso. Cada personaje debe realizar un tipo de baile diferente, mientras todos aparecen juntos en un mismo espacio y en una toma continua.
Esta capacidad abre posibilidades para herramientas de edición, campañas publicitarias, videoclips y experiencias interactivas. También permite separar la identidad visual de un personaje del movimiento que se quiere reutilizar, aunque siempre será necesario comprobar que el resultado respete los derechos y permisos de los materiales de referencia.
Disponible para desarrolladores y suscriptores
Gemini Omni 1.1 Flash comienza a desplegarse en el ecosistema de desarrollo de Google. Los usuarios pueden probarlo en Google AI Studio, mientras que las empresas pueden implementarlo mediante Gemini Enterprise Agent Platform.
Google también ofrece documentación técnica, un cookbook y guías de prompting para integrar funciones como la extensión de escenas, las referencias de video y el escalado de resolución en aplicaciones propias.
Además, Omni 1.1 está disponible globalmente para suscriptores de Google AI Plus, Pro y Ultra dentro de Google Flow. La extensión de escenas también llega a esos planes en la aplicación Gemini.
La actualización muestra hacia dónde se mueve la generación de video: menos dependencia de un único prompt y más herramientas para dirigir el resultado. La IA no reemplaza la planificación audiovisual, pero puede acelerar muchas etapas del proceso, desde el primer boceto hasta la pieza lista para producción.
Fuente original
https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash
