Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de audio diseñados para que las conversaciones con inteligencia artificial sean más naturales, rápidas y útiles. La propuesta apunta tanto a usuarios de sus aplicaciones como a empresas y desarrolladores que construyen agentes de voz.
La diferencia principal está en el objetivo de cada modelo: Gemini 3.8 Live prioriza la escala, el costo y la fluidez, mientras que Gemini 3.8 Live Extended Thinking está pensado para tareas complejas que necesitan razonamiento en varios pasos. ¿El resultado? Sistemas que pueden conversar contigo mientras trabajan en segundo plano.
Dos modelos para dos tipos de conversación
Gemini 3.8 Live combina inteligencia conversacional, diálogo fluido y comprensión visual en tiempo casi real. Esto significa que puede analizar imágenes o elementos que aparecen frente a la cámara y usarlos como contexto durante una conversación.
También puede detectar y cambiar automáticamente entre 97 idiomas compatibles en medio del diálogo. Para una persona que alterna entre idiomas o atiende clientes internacionales, esta capacidad puede hacer que la interacción se sienta menos rígida y más parecida a hablar con otra persona.
El modelo también ejecuta herramientas y llamadas a APIs mientras mantiene la conversación. Por ejemplo, puede recibir una solicitud, confirmar que comenzó a procesarla y continuar hablando contigo mientras consulta información o completa una acción en segundo plano.
Razonamiento extendido sin romper el diálogo
Gemini 3.8 Live Extended Thinking está diseñado para flujos de trabajo que requieren más análisis. Su particularidad es que puede razonar y hablar al mismo tiempo, en lugar de quedarse completamente en silencio mientras resuelve una tarea.
El modelo utiliza señales verbales tempranas como “Déjame revisarlo...” y puede narrar el progreso de una operación con varios pasos. Esto aporta contexto y reduce una de las frustraciones habituales de los agentes de voz: no saber si el sistema sigue trabajando o si dejó de responder.
Por supuesto, hablar mientras se razona no significa que todas las respuestas sean instantáneas. La ventaja está en que el usuario recibe confirmaciones y actualizaciones durante el proceso, algo especialmente útil cuando el agente debe consultar sistemas externos, ejecutar herramientas o completar tareas empresariales.
Resultados en voz y tareas de agentes
Según Google, Gemini 3.8 Live Extended Thinking obtuvo el primer lugar general en el Speech to Speech Quality Index de Artificial Analysis, con una puntuación de 82,6. Este índice evalúa la calidad de una interacción de voz a voz, incluyendo aspectos como naturalidad, capacidad de respuesta y experiencia conversacional.
En tareas agentic, es decir, aquellas en las que el modelo debe tomar acciones y completar objetivos, alcanzó los siguientes resultados:
- 68,6 % en el benchmark τ-Voice.
- 35,1 % en el benchmark bancario τ-Voice de Sierra.
- 97,7 % en Big Bench Audio, una prueba centrada en capacidades de razonamiento con audio.
Google también afirma que el modelo mantiene un precio competitivo frente a otros modelos avanzados. Estas cifras fueron obtenidas mediante la Live API en Gemini Enterprise Agent Platform, por lo que conviene interpretarlas dentro de ese entorno de evaluación y no como una garantía automática para cualquier aplicación.
Gemini 3.8 Live, por su parte, alcanzó el segundo lugar en Speech Agent Arena según la preferencia de usuarios. Su fortaleza está en ofrecer una combinación de capacidad y eficiencia para despliegues a gran escala, donde el costo por interacción y la latencia son tan importantes como la calidad de las respuestas.
Qué cambia para los desarrolladores
Los nuevos modelos llegan a la Gemini Live API, que permite crear experiencias de voz en tiempo real. Sin embargo, desarrollar un agente de este tipo no consiste únicamente en conectar un modelo y activar un micrófono.
También hay que gestionar transmisión de audio, interrupciones, turnos de conversación, latencia, llamadas a herramientas y conexiones estables. Plataformas como Agora, Fishjam, LiveKit, Pipecat, Vercel y Vision Agents ofrecen infraestructura para resolver buena parte de esa complejidad.
Esto permite que los equipos se concentren más en la experiencia del usuario. Por ejemplo, una empresa podría crear un agente para soporte técnico que escuche una explicación, consulte el historial del cliente, revise una base de conocimiento y proponga una solución sin obligar a la persona a esperar en silencio.
Google también señaló colaboraciones con Salesforce, Genspark y Lumeris. Estas empresas destacan especialmente la latencia, la naturalidad de las conversaciones y la capacidad de ejecutar herramientas mediante llamadas a funciones.
Por qué la latencia importa tanto
En un chatbot de texto, esperar algunos segundos puede ser tolerable. En una conversación de voz, ese mismo retraso se siente extraño. Las pausas largas hacen que el sistema parezca confundido o desconectado.
Por eso, los agentes de voz necesitan responder rápidamente, detectar cuándo una persona terminó de hablar y permitir interrupciones naturales. La conversación debe sentirse como un intercambio, no como una serie de mensajes grabados.
Gemini 3.8 Live busca resolver esa necesidad con procesamiento de audio casi en tiempo real, mientras que la versión Extended Thinking añade razonamiento más profundo sin abandonar completamente el canal conversacional.
Disponibilidad en productos de Google
Gemini 3.8 Live comenzó su despliegue en los siguientes canales:
- Desarrolladores: Gemini API y Google AI Studio.
- Empresas: vista previa privada en Gemini Enterprise y próximamente en Gemini Enterprise for Customer Experience.
- Usuarios generales: Search Live.
Gemini 3.8 Live Extended Thinking también comenzó a llegar a la Gemini API y Google AI Studio. Para empresas, está disponible en vista previa privada en Gemini Enterprise y llegará próximamente a Gemini Enterprise for Customer Experience y a clientes empresariales de Google Workspace.
Para usuarios finales, la versión Extended Thinking se incorpora a Gemini Live. También estará disponible para suscriptores Google AI Pro y Ultra en Workspace dentro de Docs, además de llegar a Gmail y Keep para todos los suscriptores de Google AI.
La disponibilidad puede variar según el país, el tipo de cuenta y la etapa del despliegue. En productos empresariales, una vista previa privada normalmente significa que el acceso está limitado a organizaciones o programas específicos.
SynthID incorpora una señal de procedencia
Todo el audio generado por los productos de IA de Google incluye una marca de agua SynthID. Esta señal es imperceptible para las personas y se integra directamente en el audio producido por el modelo.
Su objetivo es ayudar a detectar contenido generado por inteligencia artificial y reducir el riesgo de desinformación. No convierte el audio en verdadero o falso por sí mismo, pero aporta una capa de trazabilidad que puede ser útil para plataformas, investigadores y equipos de moderación.
La medida es relevante porque los agentes de voz pueden producir conversaciones cada vez más convincentes. A medida que la voz sintética se vuelve más natural, saber si un fragmento fue generado por IA deja de ser una curiosidad técnica y se convierte en una necesidad de confianza.
La conversación se convierte en una interfaz
Gemini 3.8 Live muestra hacia dónde se mueve la IA aplicada: menos ventanas llenas de texto y más sistemas capaces de escuchar, observar, razonar y actuar. La tecnología puede ser útil en atención al cliente, educación, soporte interno, productividad y accesibilidad.
Pero la experiencia final dependerá de algo más que las puntuaciones de los benchmarks. También serán decisivas la privacidad, la precisión de las herramientas, la capacidad de corregir errores y la claridad con la que el sistema informe lo que está haciendo.
La promesa es sencilla de entender: hablar con una IA sin tener que aprender a hablarle como a una máquina. El desafío será que esa naturalidad venga acompañada de control, transparencia y resultados confiables.
