Google presenta una nueva forma de analizar videos con Gemini. La función, llamada agentic video understanding, permite que el modelo decida qué segmentos revisar, a qué velocidad analizarlos y si necesita usar imágenes, audio o transcripciones.
La novedad llega a Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite mediante la API de Gemini, Google AI Studio y Gemini Enterprise Agent Platform. ¿La promesa principal? Analizar videos largos con mayor precisión, menos tokens y costos más bajos.
Del análisis estático a la comprensión activa
Hasta ahora, una forma habitual de procesar un video consistía en extraer fotogramas a una velocidad fija. La configuración predeterminada de la API es de 1 fotograma por segundo, aunque los desarrolladores pueden modificarla.
Este enfoque funciona para preguntas generales, pero puede perder detalles importantes. Un cambio de pocos instantes, un objeto que aparece brevemente o una anomalía visual podrían quedar entre dos fotogramas analizados.
Con la comprensión agéntica, Gemini adopta un papel más activo. En lugar de revisar todo el video de manera uniforme, utiliza herramientas internas para buscar, escanear e inspeccionar los segmentos relacionados con la pregunta.
Gemini no mira cada segundo del video de la misma forma. Decide dónde concentrar su atención y qué señal necesita consultar.
El modelo puede combinar fotogramas, audio y transcripciones dentro de un ciclo de razonamiento. Esta arquitectura se parece al enfoque de visión agéntica, que combina la comprensión nativa de imágenes con la ejecución de código para resolver tareas visuales más complejas.
Menos tokens y mayor precisión
Según las pruebas compartidas por Google, la comprensión agéntica de video puede reducir los costos de análisis hasta en 66% y el consumo de tokens hasta en 88%. Al mismo tiempo, la compañía reporta mejoras de precisión de hasta 7%.
Estos resultados son especialmente relevantes en videos extensos, como tutoriales de 10 minutos, clases de 90 minutos, grabaciones de reuniones o archivos de varias horas. En esos casos, procesar cada fotograma puede ser demasiado costoso, mientras que analizar pocos fotogramas aumenta el riesgo de perder información.
Google señala que Gemini 3.7 Flash ofrece la mejor combinación entre calidad y costo entre los modelos evaluados. En términos técnicos, la compañía lo ubica en la frontera de eficiencia entre precisión y precio, es decir, en una posición destacada para aplicaciones que necesitan buenos resultados sin disparar el presupuesto de inferencia.
Qué tareas puede resolver
La nueva capacidad está orientada a casos en los que importa encontrar detalles específicos dentro de una gran cantidad de material audiovisual.
- Recuperación de momentos de menos de un segundo: puede localizar cambios rápidos de estado o cortes precisos, algo útil para edición automática de video.
- Búsquedas complejas en videos largos: permite responder preguntas específicas sobre grabaciones de varias horas sin consumir millones de tokens.
- Detección de anomalías: puede volver a muestrear una ventana temporal a una tasa de fotogramas más alta para revisar movimientos rápidos o artefactos visuales.
- Conteo de acciones y objetos: facilita seguir movimientos repetidos y contabilizar objetos diferenciados a lo largo del tiempo.
Imagina, por ejemplo, una empresa que quiere saber en qué momento exacto de una grabación aparece una falla en una línea de producción. Con un análisis estático, tendría que aumentar la cantidad de fotogramas de todo el video o aceptar que podría pasarla por alto. Con el enfoque agéntico, Gemini puede identificar una zona sospechosa y revisarla con mayor detalle.
Cómo activarlo en la API de Gemini
La función no requiere una tarifa adicional. Google indica que utiliza los precios estándar de tokens de la API de Gemini. Para activarla, el desarrollador debe establecer el procesamiento como agentic dentro de la configuración del video.
Un ejemplo oficial en Python utiliza un video de YouTube y formula una pregunta sobre sus anuncios principales:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
La misma capacidad está disponible tanto para videos subidos por los usuarios como para videos de YouTube, siempre a través de las plataformas y servicios compatibles de Google.
Llegará también a los productos de Google
Google afirma que llevará estas mejoras de eficiencia y calidad a miles de millones de usuarios. La función se desplegará próximamente en la aplicación Gemini para los modelos Flash y Flash-Lite.
Además, durante los próximos meses, la tecnología comenzará a impulsar Ask YouTube, una función que permitirá hacer preguntas desde la página de reproducción. Las respuestas buscarán apoyarse mejor en los elementos visuales del video, no únicamente en su audio o transcripción.
El cambio muestra hacia dónde avanza el análisis multimodal. La IA ya no se limita a recibir un archivo y procesarlo de principio a fin. Puede establecer una estrategia de búsqueda, decidir qué evidencia necesita y concentrar sus recursos en los momentos relevantes.
Para los desarrolladores, eso significa menos código personalizado para construir sistemas de muestreo y búsqueda. Para los usuarios, puede traducirse en respuestas más precisas sobre videos largos. La pregunta importante ya no es si una IA puede ver un video, sino si sabe dónde mirar y por qué.
