Crear una aplicación de voz que escuche, razone y actúe mientras mantiene una conversación natural suele exigir conectar varios modelos y servicios. Google busca simplificar ese proceso con nuevos modelos de audio disponibles en Gemini API y Google AI Studio.
La compañía presentó Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking y Gemini 3.5 Transcribe, una combinación orientada a agentes conversacionales, transcripción en tiempo real y experiencias de voz más completas.
Gemini 3.8 Live lleva el razonamiento a las conversaciones de voz
Los modelos Gemini 3.8 Live permiten crear agentes que no solo responden con audio. También pueden razonar, consultar herramientas y ejecutar tareas sin romper el flujo de la conversación.
La diferencia es importante. En una arquitectura tradicional, una aplicación puede necesitar un modelo para transcribir el audio, otro para generar la respuesta y un tercero para convertir texto en voz. Gemini apuesta por una experiencia nativa de voz a voz que reduce esa complejidad.
Entre sus funciones principales se encuentran:
- Llamadas asíncronas a funciones: el agente puede ejecutar APIs o herramientas en segundo plano mientras continúa entregando una respuesta de audio.
- Contexto visual: puede combinar lo que el usuario dice con entradas visuales en directo para comprender mejor la situación.
- Precisión alfanumérica: está diseñado para interpretar códigos de confirmación, números de reclamo y datos técnicos con mayor exactitud.
- Soporte multilingüe: ofrece cobertura para más de 97 idiomas y busca conservar la consistencia del acento.
- Actualizaciones incrementales: puede mezclar audio en tiempo real con datos estructurados para entregar respuestas más relevantes.
Imagina un agente de soporte que conversa contigo, consulta el estado de un pedido en una API y te responde por voz mientras espera los datos. No tendría que quedarse en silencio durante cada llamada externa. Esa continuidad puede hacer que la interacción se sienta mucho más natural.
Razonamiento configurable para solicitudes complejas
Gemini 3.8 Live Extended Thinking incorpora un modo de razonamiento configurable. El modelo puede trabajar en tareas de varios pasos en segundo plano mientras responde o explica el avance dentro de la conversación principal.
Google afirma que esta versión ocupa el primer lugar en el ranking de Artificial Analysis para razonamiento entre los modelos evaluados. Como siempre, este tipo de posición depende de la fecha, la metodología y las pruebas utilizadas, por lo que conviene revisar el benchmark antes de tomar decisiones técnicas.
Gemini 3.5 Transcribe convierte voz en texto con precisión
Para aplicaciones que necesitan texto en tiempo real, Google también presentó Gemini 3.5 Transcribe. Es un modelo especializado de voz a texto compatible con más de 85 idiomas.
Según Google, alcanzó un Word Error Rate (WER) promedio de 4,0 % en transcripción por streaming y de 2,6 % en transcripción sin streaming. El WER mide la proporción de palabras transcritas incorrectamente, aunque el resultado real puede cambiar según el ruido, el micrófono, el acento y el tipo de conversación.
El modelo incluye funciones especialmente útiles para productos de voz:
- Cambio automático de idioma: reconoce cambios de idioma dentro de una misma frase o entre frases sin configuración manual.
- Vocabulario personalizado: permite priorizar términos especializados, nombres de empresas, nombres propios y jerga del sector mediante una lista
custom_vocabularyde hasta 1.000 términos. - Modo de transcripción inteligente: produce textos más limpios, con formato estructurado, autocorrecciones y eliminación de palabras de relleno.
Estas capacidades pueden servir para subtítulos con latencia inferior a un segundo, agentes para centros de llamadas, análisis de conversaciones y herramientas de accesibilidad. También es posible usar el modelo mediante la Interactions API para transcribir archivos de audio de hasta una hora, con marcas de tiempo estructuradas y separación por hablantes.
Una arquitectura de audio más simple para desarrolladores
La propuesta de Google no se limita a un único modelo. La empresa está agrupando varias piezas para construir productos de audio desde Gemini API:
- Gemini 3.5 Live Translate: traducción de voz a voz en más de 70 idiomas.
- Gemini 3.1 Flash TTS: generación de voz configurable.
- Lyria 3.5: generación de música orientada a entornos de producción.
Para comenzar, los desarrolladores pueden probar los modelos en Google AI Studio Live, clonar aplicaciones de ejemplo desde GitHub o utilizar la guía de capacidades para agentes de la Live API.
Desde el punto de vista técnico, el atractivo principal está en reducir la necesidad de arquitecturas en cascada. En vez de coordinar manualmente reconocimiento de voz, razonamiento, llamadas a herramientas y síntesis de audio, una aplicación puede delegar más pasos en un modelo de voz nativo. Eso no elimina la necesidad de diseñar bien la latencia, los permisos, la observabilidad y el manejo de errores, pero sí puede acelerar el desarrollo.
La voz deja de ser solo una interfaz para enviar comandos. Con estos modelos, puede convertirse en una capa completa para conversar, consultar información, interpretar imágenes y ejecutar acciones.
El reto será comprobar cómo funcionan estas promesas fuera de las demostraciones: con ruido de fondo, interrupciones, acentos, conversaciones largas y datos sensibles. Aun así, la dirección es clara. Las aplicaciones de voz ya no tienen que limitarse a contestar preguntas; pueden convertirse en agentes capaces de acompañar una tarea de principio a fin.
