Google presentó Gemini 3.1 Flash Live, su nuevo modelo de audio en tiempo real diseñado para conversaciones más naturales, rápidas y confiables. La actualización apunta tanto a desarrolladores que crean agentes de voz como a empresas y usuarios que interactúan con Gemini y Search.
¿Qué cambia cuando una IA entiende mejor una conversación hablada? No se trata solo de responder con menos demora. También debe seguir el hilo, interpretar pausas, reconocer frustración y ejecutar tareas con varios pasos sin perderse en el camino.
Un modelo de voz pensado para conversaciones reales
Gemini 3.1 Flash Live mejora la capacidad de Gemini para mantener diálogos fluidos. Según Google, el modelo responde más rápido que su versión anterior y puede conservar el contexto de una conversación durante el doble de tiempo en Gemini Live.
Esto resulta especialmente útil en sesiones largas de lluvia de ideas, explicaciones técnicas o resolución de problemas. En lugar de obligarte a repetir cada detalle, el modelo puede mantener una línea de conversación más amplia y aprovechar lo que ya dijiste.
La mejora también está en la forma de hablar. Gemini 3.1 Flash Live analiza señales acústicas como el tono y el ritmo de la voz. Así puede detectar, por ejemplo, que una persona está confundida o frustrada y ajustar su respuesta para ser más clara y útil.
La naturalidad de una IA de voz no depende únicamente de que pronuncie bien las palabras. También depende de que sepa cuándo detenerse, cómo reaccionar y qué información mantener en contexto.
Más capacidad para ejecutar tareas complejas
Para los desarrolladores, una de las novedades centrales es la mejora en el uso de herramientas mediante function calling. Esta capacidad permite que el modelo no solo converse, sino que también active funciones externas, consulte sistemas o complete procesos siguiendo varias instrucciones.
En ComplexFuncBench Audio, un benchmark que evalúa llamadas a funciones con múltiples pasos y restricciones, Gemini 3.1 Flash Live obtuvo una puntuación de 90,8 %. Google afirma que este resultado supera al de su modelo anterior.
En Audio MultiChallenge, una prueba de Scale AI enfocada en seguir instrucciones complejas y razonar durante periodos prolongados, alcanzó 36,1 % con el modo de razonamiento activado. El benchmark incluye interrupciones, pausas y dudas similares a las que aparecen en conversaciones reales.
Estas métricas no significan que el modelo sea perfecto. Sí muestran hacia dónde avanza la IA de voz: agentes capaces de escuchar una petición, dividirla en pasos y completar una tarea sin depender de comandos rígidos.
Dónde pueden usarlo los desarrolladores
Gemini 3.1 Flash Live está disponible para desarrolladores en fase de vista previa mediante la Gemini Live API, dentro de Google AI Studio. Con esta API, los equipos pueden experimentar con aplicaciones de voz en tiempo real y agentes capaces de interactuar de manera más flexible.
Entre los posibles usos están:
- Asistentes de soporte técnico que hagan preguntas y guíen al usuario paso a paso.
- Agentes para centros de atención que detecten señales de confusión o frustración.
- Herramientas educativas que adapten sus explicaciones al ritmo de cada persona.
- Aplicaciones que combinen voz, texto, imágenes y acciones externas.
Google también menciona comentarios positivos de empresas como Verizon, LiveKit y The Home Depot, que han probado el modelo en sus flujos de trabajo.
Disponibilidad para empresas y usuarios
En el entorno empresarial, Gemini 3.1 Flash Live llega a Gemini Enterprise for Customer Experience. La propuesta es ayudar a las compañías a construir experiencias de atención más conversacionales, capaces de reconocer matices de la voz y responder de forma dinámica.
Para el público general, el modelo está presente en Gemini Live y Search Live. En este último caso, Google anuncia una expansión global que permite mantener conversaciones multimodales en tiempo real con Search en el idioma preferido del usuario, en más de 200 países y territorios.
Eso puede servir para resolver dudas cotidianas, recibir ayuda con una reparación o explorar un tema sin escribir cada consulta. La voz se convierte así en una puerta de entrada más directa a la búsqueda y a la asistencia digital.
Audio generado con marca de agua SynthID
Todo el audio generado por Gemini 3.1 Flash Live incluye una marca de agua imperceptible creada con SynthID. Esta señal está integrada directamente en la salida de audio y permite detectar de forma confiable si fue producido por inteligencia artificial.
La medida busca ayudar a combatir la desinformación y facilitar la identificación de contenido sintético. No elimina todos los riesgos asociados con la voz generada por IA, pero añade una capa importante de trazabilidad para plataformas, empresas y usuarios.
Gemini 3.1 Flash Live muestra que la evolución de la IA conversacional no consiste únicamente en hacer modelos más rápidos. El reto es lograr que escuchen mejor, razonen durante más tiempo y respondan de una manera que tenga sentido en una conversación humana.
Para los desarrolladores, el avance está en combinar diálogo, herramientas y contexto. Para el resto de nosotros, la diferencia se nota en algo más simple: poder hablar con una IA sin sentir que hay que aprender un idioma especial para que nos entienda.
Fuente original
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-live
