Google presentó nueve demostraciones de Gemini Omni y Gemini 3.5 Flash durante Google I/O 2026. La primera línea apunta a la creación y edición de video con múltiples tipos de entrada; la segunda, a agentes capaces de ejecutar tareas complejas, escribir código y construir experiencias personalizadas.
La diferencia clave está en el enfoque. Gemini Omni busca convertir imágenes, audio, video y texto en nuevas piezas audiovisuales. Gemini 3.5 Flash se concentra en razonar, actuar y completar flujos de trabajo de varios pasos con rapidez.
Gemini Omni: crear y editar video conversando
1. Cambiar elementos de una escena con lenguaje natural
Con Gemini Omni, una persona puede tomar un video existente y pedir cambios específicos sin tener que dominar un editor tradicional. Por ejemplo, la demostración transforma una escultura para que parezca hecha de burbujas.
La idea es que cada instrucción se apoye en la anterior. El modelo intenta conservar la identidad de los personajes, la continuidad de la escena y la coherencia física mientras modifica el contenido.
El video deja de ser el resultado final de una grabación y se convierte en el punto de partida para crear algo nuevo.
2. Reimaginar la acción de un video
Omni también puede alterar lo que ocurre dentro de una toma. Es posible cambiar la iluminación, añadir objetos o personajes y convertir una acción cotidiana en una secuencia completamente distinta.
Una de las demostraciones propone oscurecer una habitación y crear una esfera de vidrio flotando sobre una mano. Dentro de la esfera aparece una representación recursiva de la misma mano, con habitaciones que se repiten hasta formar un efecto visual infinito.
Este tipo de edición muestra el potencial del modelo para trabajar con instrucciones creativas complejas, no solo con ajustes simples de color o recorte.
3. Refinar un video en varias rondas
La edición puede continuar durante múltiples turnos de conversación. El usuario cambia el entorno, el ángulo de cámara, el estilo visual o detalles concretos sin tener que describir nuevamente toda la escena.
En términos técnicos, el reto consiste en mantener el contexto visual a lo largo de varias generaciones. Si el modelo pierde la apariencia de un personaje o modifica elementos que debían permanecer intactos, la edición deja de ser útil. Google afirma que Omni está diseñado para conservar ese hilo narrativo.
Gemini 3.5 Flash: agentes que razonan y actúan
4. Automatizar tareas con muchos pasos
Gemini 3.5 Flash está orientado a tareas llamadas agentic, en las que el modelo no se limita a responder una pregunta. También puede planificar una secuencia, usar herramientas y revisar resultados para alcanzar un objetivo.
En una demo con Antigravity, el modelo renombra y clasifica activos desorganizados según criterios que pueden cambiar dinámicamente. Este escenario es parecido al trabajo que realizan equipos de diseño, marketing o desarrollo cuando necesitan ordenar grandes cantidades de archivos.
5. Coordinar subagentes con Antigravity
Al combinar 3.5 Flash con el entorno actualizado de Antigravity, Google muestra varios subagentes colaborando bajo supervisión. Cada uno puede encargarse de una parte del problema, mientras el sistema coordina el flujo completo.
Este enfoque resulta especialmente útil para tareas de programación y operaciones complejas. En lugar de pedirle a un único modelo que haga todo, se distribuyen responsabilidades y se mantiene una supervisión humana para validar los pasos importantes.
La velocidad de la familia Flash es parte de la propuesta. Un agente que razona bien, pero tarda demasiado en cada acción, puede ser poco práctico en un flujo de trabajo real.
6. Crear interfaces y gráficos interactivos
En AI Studio, Gemini 3.5 Flash genera diferentes propuestas de experiencia de usuario para un flujo de pago en aproximadamente 60 segundos, según Google.
El objetivo no es solo producir código. El modelo puede explorar varias alternativas de diseño y convertir una idea en una interfaz más interactiva. Para un emprendedor que está validando una tienda en línea, esto puede acelerar la comparación entre diseños antes de invertir tiempo en una implementación definitiva.
Nuevas funciones con agentes en Search y Gemini
7. Agentes de información que trabajan en segundo plano
Google también está integrando las capacidades agentic de 3.5 Flash en Search. Los llamados information agents pueden seguir temas específicos y enviar actualizaciones cuando aparece información relevante.
Una demostración muestra un agente que vigila si determinados atletas anuncian colaboraciones con marcas de calzado o lanzan productos exclusivos. La actualización incluiría un resumen y enlaces para consultar las fuentes originales.
Estos agentes plantean una diferencia importante frente a una búsqueda tradicional: no esperan a que la persona formule una nueva consulta, sino que supervisan un tema bajo instrucciones previas.
Google indica que esta función llegará primero a los suscriptores de Google AI Pro y Ultra durante el verano de 2026.
8. Generar herramientas visuales y experiencias personalizadas
Search también podrá crear respuestas interactivas adaptadas a la pregunta. En lugar de mostrar únicamente enlaces y texto, el sistema puede construir una herramienta visual, una simulación o una interfaz generativa en tiempo real.
Entre los ejemplos presentados aparece una explicación interactiva de los patrones gyroid. Para tareas continuas, como planificar una boda o establecer una rutina de ejercicio, Search podría generar paneles, rastreadores o pequeñas aplicaciones que el usuario consulte más adelante.
Google afirma que las funciones de interfaz generativa estarán disponibles para todos los usuarios de Search durante el verano, sin costo. La creación de experiencias personalizadas con Antigravity llegará en los meses siguientes, inicialmente para suscriptores Pro y Ultra en Estados Unidos.
9. Gemini Spark como agente personal
La novena demostración presenta Gemini Spark, un agente personal basado en Gemini 3.5 y el entorno Antigravity. Su propósito es ayudar a gestionar tareas digitales de forma continua, siempre bajo la dirección del usuario.
Spark está integrado con herramientas de Workspace como Gmail, Docs y Slides. En el ejemplo, crea una lista de snacks sin frutos secos y luego los añade a Instacart.
La utilidad es clara, pero también exige controles precisos. Un agente que puede actuar en nombre de una persona necesita permisos limitados, confirmaciones para acciones sensibles y una forma sencilla de revisar lo que hizo.
Disponibilidad de Gemini Omni y Gemini 3.5 Flash
Google informa que Gemini Omni Flash está llegando a los suscriptores de Google AI Plus, Pro y Ultra en todo el mundo a través de la aplicación Gemini y Google Flow. También estará disponible sin costo en YouTube Shorts y la aplicación YouTube Create.
La compañía planea ofrecer Omni a desarrolladores y clientes empresariales mediante APIs en las semanas siguientes. Para los usuarios de estas plataformas, la disponibilidad de modelos multimodales será especialmente relevante porque permitirá incorporar generación y edición de video en productos propios.
Por su parte, Gemini 3.5 Flash está disponible de forma general en Google Antigravity, Gemini API dentro de Google AI Studio, Android Studio, Gemini Enterprise Agent Platform y Gemini Enterprise. También está disponible para todos los usuarios en AI Mode de Search y se está desplegando globalmente en la aplicación Gemini.
La presentación deja una señal clara: Google está intentando mover la IA desde la generación de respuestas hacia la ejecución de tareas. Omni quiere que crear video sea tan conversacional como pedir una idea. 3.5 Flash busca que los agentes puedan convertir esa intención en acciones concretas, desde ordenar archivos hasta construir una herramienta personalizada.
El verdadero desafío no será solo demostrar que estos modelos pueden hacerlo, sino lograr que sus resultados sean consistentes, verificables y seguros cuando empiecen a trabajar con información y servicios reales.
Fuente original
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-3-5-videos
