Google muestra cómo cinco creadores están usando Gemini Omni para transformar videos, cambiar perspectivas y convertir ideas sencillas en escenas completas. La propuesta busca que editar video sea tan natural como describir lo que quieres en una conversación.
Qué es Gemini Omni y por qué importa
Gemini Omni Flash es el primer modelo de la nueva familia Omni. Puede generar y editar videos usando referencias de texto, imágenes, videos o audio, e incluso modificar grabaciones propias sin perder la continuidad de la escena.
En términos técnicos, se trata de un modelo multimodal: entiende distintos tipos de información y los combina para producir un resultado visual coherente. Google también destaca su comprensión intuitiva de la física y su conocimiento del mundo real, dos capacidades importantes para que los objetos, movimientos y entornos parezcan más naturales.
La idea no es únicamente crear un video desde cero, sino poder conversar con una escena y transformarla sin reconstruirla manualmente.
Recientemente, Google dio acceso a Omni para desarrolladores. Estos son algunos de los proyectos que la compañía destacó.
Cambiar cámaras y perspectivas sin volver a grabar
Una de las demostraciones más llamativas pertenece a Leon Lin, conocido como @LexnLin en X. El creador mostró a una mujer en medio de una ciudad desde alrededor de 20 perspectivas diferentes.
La misma escena puede verse de cerca, a distancia, de frente, de perfil, desde arriba o desde abajo. También es posible aplicar acercamientos cinematográficos, mantener la cámara fija y modificar el entorno con aceras, cruces peatonales, tranvías, automóviles y edificios distintos.
El reto aquí es mantener la identidad de la escena mientras cambia la cámara. En un editor tradicional, cada ángulo adicional podría requerir una nueva grabación o una compleja reconstrucción digital. Omni intenta resolverlo mediante instrucciones visuales y lenguaje natural.
Transformar el entorno usando la voz
El creador Carlos Santana, @DotCSV en X, mostró otra posibilidad: cambiar lo que ocurre dentro de un video sin filmar nuevamente la escena.
A través de instrucciones de voz, convirtió una toma exterior de día en una escena nocturna. También añadió nubes, sonidos de lluvia, hojas anaranjadas y nieve cubriendo el suelo.
La parte relevante no es solo aplicar filtros aislados. El modelo debe coordinar iluminación, clima, sonido y apariencia del entorno para que todo parezca pertenecer al mismo momento. Esa consistencia temporal y espacial es uno de los problemas más difíciles de la generación de video.
De un dibujo a un objeto animado
En Google Flow, Omni puede usar garabatos para guiar el movimiento de elementos dentro de una escena. El creador decide además si esos dibujos permanecen visibles en el resultado final o si solo funcionan como instrucciones para el modelo.
Pan, identificado como @sebatheepan, utilizó esta función para convertir objetos cotidianos en personajes y vehículos imaginarios:
- Un limón se transforma en un submarino que se mueve bajo el océano.
- Una taza de espresso se convierte en un globo aerostático.
- Dos chiles forman un dragón dormido que expulsa fuego al despertarse.
- Un fósforo se transforma en una nave espacial.
- Unas tijeras se convierten en un tiburón en busca de alimento.
Este tipo de flujo puede resultar útil para animadores, docentes, diseñadores y equipos de marketing. No reemplaza necesariamente el criterio creativo, pero reduce la distancia entre una idea dibujada rápidamente y una primera versión animada.
Probar estilos visuales con una misma escena
¿Quieres saber cómo se vería un video real convertido en anime o en una animación de plastilina? Gemini Omni también permite cambiar el estilo visual a partir de referencias o descripciones escritas.
Jerrod Lew, @jerrod_lew en X, puso a prueba esta capacidad con una mujer caminando por una calle. La secuencia pasa de acción real a anime, claymation y otros estilos, mientras la progresión del movimiento se mantiene.
La continuidad del desplazamiento es fundamental. Si el personaje cambia de posición de forma arbitraria entre fotogramas, el resultado se siente roto. Al conservar la trayectoria y modificar la estética, Omni demuestra una separación más clara entre el contenido de la escena y su apariencia visual.
Convertir ideas de negocio en demostraciones
El equipo de Hyperagent, @hyperagentapp en X, usó Omni para visualizar tres conceptos diferentes.
En el primero, añadió un diseño de paisajismo a un parque vacío para crear una comparación de antes y después. En el segundo, personificó datos mediante un profesor animado que explica paneles empresariales. En el tercero, convirtió una lista de tareas en una experiencia gamificada donde un personaje va completando objetivos.
Estos ejemplos muestran una aplicación especialmente práctica: utilizar video generado para explicar propuestas, prototipos o procesos antes de invertir en una producción completa. Para una startup, una agencia o un equipo de producto, un prototipo audiovisual puede facilitar conversaciones que serían difíciles de sostener con solo texto o diapositivas.
Dónde se puede probar
Google indica que Omni está disponible en distintos productos y plataformas de desarrollo:
- La aplicación de Gemini.
- Google Flow.
- Google AI Studio.
- La API de Gemini.
- Gemini Enterprise Agent Platform.
Para los desarrolladores, el punto importante será comprobar cómo se comporta el modelo fuera de las demostraciones seleccionadas: qué latencia ofrece, cuánto cuesta generar o editar un clip, qué resolución entrega y qué tan bien conserva personajes y objetos en secuencias largas.
También será necesario considerar derechos de autor, consentimiento de las personas que aparecen en los videos y la identificación de contenido generado por IA. Cuanto más fácil sea alterar una grabación real, más importante será distinguir entre una edición auténtica y una escena sintetizada.
Gemini Omni apunta a una evolución concreta de la creación audiovisual: pasar de editar cada detalle manualmente a describir transformaciones y supervisar el resultado. La herramienta no elimina la necesidad de dirección, criterio o revisión, pero puede permitir que más personas conviertan un boceto, una grabación o una idea de negocio en una experiencia visual funcional.
Fuente original
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-builders
