Google presenta Gemini Omni, una nueva familia de modelos multimodales que combina razonamiento, generación y edición de contenido. Su primer modelo, Gemini Omni Flash, puede recibir texto, imágenes, video y audio como referencia para crear clips de alta calidad, empezando por la generación de video.
La propuesta busca que editar un video sea tan sencillo como mantener una conversación. ¿Quieres cambiar el escenario, modificar una acción o convertir una escultura en burbujas? En lugar de aprender un editor complejo, puedes describir el cambio con lenguaje natural.
Gemini Omni convierte la edición en una conversación
Una de las funciones centrales de Omni es la edición mediante instrucciones sucesivas. Cada indicación toma en cuenta lo que ocurrió antes, de modo que puedes ajustar el resultado en varios turnos sin perder la continuidad de la escena.
Según Google, el modelo está diseñado para mantener consistentes a los personajes, respetar la física de los objetos y recordar los elementos importantes del video original. En la práctica, podrías comenzar con una toma de una persona caminando, cambiar el entorno, añadir un objeto y después modificar el estilo visual sin reconstruir todo desde cero.
También es posible transformar la acción de un video existente. Una grabación cotidiana puede convertirse en una escena fantástica, incorporar nuevos personajes o mostrar un acontecimiento que nunca fue filmado originalmente.
La idea central es pasar de editar cada detalle manualmente a dirigir el resultado con instrucciones claras.
Más que imágenes realistas: escenas con contexto
Gemini Omni no se limita a producir imágenes visualmente atractivas. Google afirma que el modelo utiliza el conocimiento general de Gemini para conectar lenguaje, imágenes y significado, además de representar mejor fenómenos físicos como la gravedad, la energía cinética y la dinámica de fluidos.
Esto puede ser útil para crear una reacción en cadena con objetos que se mueven de forma coherente o para representar una explicación científica con imágenes. Por ejemplo, un prompt puede pedir una animación en plastilina sobre el plegamiento de proteínas, con una estética de stop motion y una explicación visual precisa.
La combinación entre razonamiento y generación también permite producir contenidos educativos. Un usuario podría solicitar un video sobre historia, ciencia o cultura y recibir una secuencia visual que traduzca una idea compleja a ejemplos más fáciles de seguir.
Claro, esto no significa que cada resultado sea automáticamente correcto. En temas educativos o científicos, la revisión humana sigue siendo necesaria. La capacidad de crear una explicación convincente no garantiza que todos sus datos sean exactos.
Videos a partir de cualquier combinación de referencias
Omni puede combinar distintos tipos de entrada para producir un clip cohesivo. Puedes aportar una imagen de un personaje, un dibujo de una escena, un video de referencia o una instrucción escrita para definir el resultado.
También puedes describir el estilo, el movimiento y los efectos mediante lenguaje natural. La herramienta intenta unir esas referencias en una misma pieza visual, en lugar de tratarlas como elementos aislados.
Google señala que, inicialmente, el audio podrá utilizarse como referencia de voz. La compañía planea añadir otros tipos de entradas de audio más adelante. En cuanto a las salidas, la primera etapa está centrada en video, aunque se esperan modalidades como imagen y audio en el futuro.
Un ejemplo práctico
Imagina que tienes un boceto de un personaje, una fotografía de un escenario y un audio con una narración. Con Omni podrías pedir un video que use el personaje del dibujo, conserve la atmósfera de la fotografía y sincronice la escena con la voz de referencia.
El resultado dependerá de la calidad de las referencias y de la precisión de la instrucción, pero el flujo de trabajo reduce varios pasos que antes requerían programas distintos.
Avatares digitales y controles de seguridad
Gemini Omni también permitirá crear videos con un avatar digital basado en la propia voz del usuario. La función busca generar una versión digital de una persona para producir videos que se parezcan y suenen como ella.
Google indica que todavía está probando de manera responsable las funciones relacionadas con la modificación de audio y habla. Esto es importante porque las herramientas capaces de imitar identidades pueden tener usos legítimos, pero también facilitar suplantaciones, fraudes y desinformación.
Todos los videos creados con Omni incluyen una marca de agua digital imperceptible llamada SynthID. Google afirma que esta señal permite verificar si un video fue generado con Gemini Omni desde la aplicación Gemini, Gemini en Chrome y Google Search.
La marca no reemplaza la verificación periodística ni resuelve por sí sola el problema de los contenidos sintéticos. Sin embargo, ofrece una capa adicional para identificar el origen de una pieza cuando la tecnología de generación resulta difícil de detectar a simple vista.
Disponibilidad de Gemini Omni Flash
El primer modelo de la familia, Gemini Omni Flash, comenzó su despliegue global para suscriptores de Google AI Plus, Pro y Ultra a través de la aplicación Gemini y Google Flow.
Google también anunció su llegada sin costo a usuarios de YouTube Shorts y de la aplicación YouTube Create. La disponibilidad puede variar según el producto, el país y la etapa de implementación.
En las próximas semanas, la compañía planea ofrecer el modelo a desarrolladores y clientes empresariales mediante APIs. Esto podría abrir la puerta a herramientas de marketing, educación, producción audiovisual y creación de contenido integradas directamente en otras aplicaciones.
Gemini Omni representa una evolución importante en la generación de video porque no solo intenta crear una escena a partir de un prompt. Su apuesta es permitir que una persona razone sobre la escena, la modifique paso a paso y combine referencias distintas sin tener que dominar un flujo técnico de edición.
La pregunta ya no es únicamente si la IA puede producir un video. Ahora también importa si puede mantener una intención creativa durante todo el proceso, entender qué debe cambiar y ayudar a convertir una idea incompleta en una historia visual coherente.
Fuente original
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni
