Google acaba de ampliar su plataforma para crear imágenes y videos con inteligencia artificial. Nano Banana 2 Lite llega como el modelo de imágenes más rápido y económico de la familia, mientras Gemini Omni Flash incorpora generación y edición conversacional de video para desarrolladores.
La propuesta es bastante clara: generar imágenes rápidamente, convertirlas en videos y editarlas mediante instrucciones escritas. ¿Qué significa esto en la práctica? Que un equipo puede pasar de una idea visual a un prototipo multimedia sin tener que conectar tantas herramientas diferentes.
Nano Banana 2 Lite prioriza velocidad y volumen
Nano Banana 2 Lite, identificado técnicamente como gemini-3.1-flash-lite-image, está diseñado para flujos de trabajo donde la latencia y el costo importan especialmente. Google lo recomienda como reemplazo directo del Nano Banana original, conocido en la API como gemini-2.5-flash-image.
El modelo genera imágenes a partir de texto en aproximadamente 4 segundos y tiene un costo anunciado de 0,034 dólares por imagen en resolución 1K. Esto puede resultar relevante para aplicaciones que necesitan producir muchas variantes, como catálogos de productos, pruebas de diseño, campañas publicitarias o herramientas de prototipado visual.
A pesar de estar optimizado para velocidad, Google asegura que mantiene capacidades importantes:
- Buena obediencia a las instrucciones del usuario.
- Consistencia razonable de personajes.
- Texto legible dentro de las imágenes.
- Rendimiento adecuado para generación y edición rápida.
La diferencia frente a un modelo más potente se encuentra en el equilibrio. Nano Banana 2 Lite no busca ser la opción con mayor control profesional, sino la más conveniente cuando necesitas iterar muchas veces y mantener bajo el presupuesto.
Cómo se compara con la familia Nano Banana
Google organiza sus modelos de imágenes según el tipo de proyecto:
- Nano Banana 2 Lite, o
Gemini 3.1 Flash Lite Image: pensado para velocidad, baja latencia y grandes volúmenes. - Nano Banana 2, o
Gemini 3.1 Flash Image: una alternativa generalista con un balance entre calidad, rapidez y costo. - Nano Banana Pro, o
Gemini 3 Pro Image: orientado a trabajos profesionales que requieren mayor control, precisión y razonamiento. - Nano Banana, o
Gemini 2.5 Flash Image: la versión anterior, que Google recomienda actualizar.
Nano Banana 2 Lite está disponible en Google AI Studio, Gemini API y Gemini Enterprise Agent Platform. También comienza a integrarse en productos de consumo como AI Mode en Search, la aplicación Gemini, NotebookLM, Google Photos, Stitch, Google Flow y Google Ads.
Gemini Omni Flash lleva la edición de video a la conversación
La segunda novedad es Gemini Omni Flash, identificado como gemini-omni-flash-preview. El modelo combina razonamiento multimodal con generación y edición de video. Puede trabajar con instrucciones de texto, imágenes y videos como entradas.
Su precio anunciado es de 0,10 dólares por segundo de video generado, el mismo costo indicado por Google para Veo 3.1 Fast. Actualmente está disponible en vista previa pública mediante Google AI Studio y Gemini API.
Su principal diferencia es la edición conversacional. En vez de modificar un video con una interfaz llena de controles, puedes pedir cambios en lenguaje natural. Por ejemplo, podrías solicitar que una escena tenga una iluminación más cálida, que aparezca un objeto adicional o que el movimiento de cámara sea más cinematográfico.
Entre sus capacidades destacan:
- Edición de video mediante instrucciones sucesivas.
- Uso combinado de texto, imágenes y videos como referencias.
- Aplicación de conocimientos del mundo real para construir escenas con lógica narrativa.
- Sincronización entre texto, gráficos y acciones dentro del video.
La combinación de entradas multimodales también ayuda a mantener el control creativo. Una imagen puede definir la apariencia de un producto, mientras que una instrucción textual establece el movimiento, el ambiente o la acción que debe ocurrir.
Limitaciones actuales de Omni Flash
Gemini Omni Flash todavía está en una etapa de vista previa. Por eso, Google señala varias restricciones importantes:
- Las generaciones están limitadas actualmente a videos de 10 segundos.
- La API todavía no admite referencias de audio ni extensión de escenas.
- Aunque el esquema de la API acepta videos de referencia de hasta 3 segundos, el modelo aún no los procesa correctamente.
- La consistencia de los personajes puede disminuir al cambiar de escena o realizar movimientos panorámicos.
Estas limitaciones son relevantes para cualquier aplicación comercial. Un prototipo puede verse impresionante, pero un producto listo para producción necesita evaluar consistencia, tiempos de respuesta, costos y comportamiento ante distintos tipos de instrucciones.
El flujo más interesante combina ambos modelos
La idea central de Google no es utilizar estos modelos de forma aislada. El flujo recomendado consiste en generar una imagen con Nano Banana 2 Lite y pasarla después a Gemini Omni Flash para convertirla en un clip animado.
Un ejemplo sencillo sería crear el concepto visual de una habitación con Nano Banana 2 Lite. Luego, Omni Flash puede transformar esa imagen en un recorrido cinematográfico que muestre el espacio desde distintos ángulos. El mismo patrón puede aplicarse a productos, destinos turísticos, personajes o piezas publicitarias.
Para experiencias con varias rondas de edición, Google propone utilizar la Interactions API. Esta interfaz permite conservar el historial y el contexto de una sesión, de modo que el usuario pueda encadenar hasta tres ediciones secuenciales sin explicar todo de nuevo en cada paso.
La ventaja no está solo en generar contenido, sino en construir una experiencia donde el usuario pueda crear, revisar y corregir sin perder el hilo.
Tres demostraciones para probar el flujo
Google presentó varias aplicaciones de demostración que muestran cómo trabajar con los dos modelos:
- Anywhere toma una selfie o una fotografía y utiliza Nano Banana 2 Lite para ubicar a la persona en distintos lugares icónicos. Después, Gemini Omni Flash convierte la imagen seleccionada en un clip animado.
- Space Lift permite cargar la imagen de una habitación, generar propuestas de diseño interior y animar la alternativa elegida con un video de presentación.
- Omni Product Studio transforma imágenes estáticas de productos en videos comerciales con apariencia cinematográfica.
Estas demos apuntan a una tendencia importante: las aplicaciones de IA generativa comienzan a funcionar como cadenas de producción multimedia. Una imagen deja de ser el resultado final y se convierte en el primer paso para crear una pieza de video, una campaña o una experiencia interactiva.
Disponibilidad, seguridad y recursos para desarrolladores
Los dos modelos se pueden probar en Google AI Studio. También están disponibles mediante la Gemini API, aunque Omni Flash se ofrece como vista previa y sus capacidades pueden variar según la región y la integración utilizada.
Google indica que ambos modelos funcionan sobre su infraestructura segura y utilizan marcas de agua SynthID. La compañía también permite verificar contenido generado por IA mediante la aplicación Gemini, Gemini en Chrome y Search.
Para comenzar, los desarrolladores pueden consultar:
- El entorno de pruebas de Google AI Studio.
- La documentación de Gemini API.
- La guía de prompting de Nano Banana.
- La guía de prompting de Gemini Omni Flash.
La estrategia de Google apunta a cubrir dos necesidades distintas. Nano Banana 2 Lite reduce el tiempo y el costo de la exploración visual. Omni Flash añade una capa de movimiento, edición y razonamiento multimodal. Juntos pueden acelerar desde un simple boceto hasta una experiencia multimedia completa, aunque todavía conviene probarlos con casos reales antes de comprometerse con una aplicación de producción.
