Google presenta Gemini 3.5 Live Translate, un modelo de audio diseñado para traducir conversaciones habladas casi en tiempo real. La herramienta detecta más de 70 idiomas y genera una voz traducida que intenta conservar la entonación, el ritmo y el tono de quien habla.
La diferencia no está solo en cuántos idiomas reconoce. También está en cómo responde: en lugar de esperar a que una persona termine cada frase, el sistema procesa el audio mientras llega y produce traducción de forma continua. ¿El resultado? Menos pausas incómodas y un retraso de apenas unos segundos durante la conversación.
Traducción de voz sin esperar cada turno
Muchos sistemas de traducción funcionan por turnos. Escuchan una frase completa, la procesan y luego entregan el resultado. Ese enfoque puede ser preciso, pero rompe el ritmo de una conversación natural.
Gemini 3.5 Live Translate intenta resolver ese problema mediante procesamiento de audio en streaming. El modelo recibe la voz de manera progresiva y debe equilibrar dos objetivos que suelen entrar en conflicto: esperar suficiente contexto para mejorar la calidad o responder rápido para mantenerse sincronizado con el hablante.
Además, puede trabajar con entradas multilingües sin que el usuario tenga que configurar manualmente cada idioma. Google también destaca su resistencia al ruido, una característica importante para llamadas, reuniones, clases, transmisiones y conversaciones en lugares impredecibles.
La traducción deja de sentirse como una serie de respuestas separadas y se acerca más a una conversación continua.
Dónde estará disponible Gemini 3.5 Live Translate
El lanzamiento llega a distintos productos y públicos:
- Desarrolladores: acceso en vista previa pública mediante la
Gemini Live APIy Google AI Studio. - Empresas: vista previa privada en Google Meet para clientes seleccionados de Google Workspace.
- Usuarios generales: despliegue global en Google Translate para Android y iOS.
Para los desarrolladores, la API permite crear funciones de interpretación en directo, doblaje y traducción simultánea a varios idiomas. Plataformas como Agora, Fishjam, LiveKit, Pipecat y Vision Agents ya integran la infraestructura de transmisión multimedia, de modo que los equipos pueden concentrarse en diseñar la experiencia final.
Esto abre posibilidades para llamadas multilingües, reuniones internacionales, cursos, eventos y transmisiones. Grab, por ejemplo, está probando el modelo para facilitar la comunicación entre conductores y viajeros durante los puntos de recogida. La empresa procesa más de 10 millones de llamadas de voz al mes entre sus usuarios.
Google Meet amplía sus idiomas de traducción
Google también prepara una actualización de la traducción de voz en Meet. La función pasará de un límite anterior de cinco idiomas a más de 70, y permitirá trabajar con más de 2.000 combinaciones lingüísticas en una misma reunión.
Otro cambio será la posibilidad de traducir entre idiomas sin depender exclusivamente del inglés como idioma intermedio. La interfaz también se actualizará para ofrecer acceso más directo a la traducción de voz.
La función comienza en vista previa privada para algunos clientes empresariales durante este mes y tendrá una distribución más amplia posteriormente en 2026.
Traducción desde el teléfono y los audífonos
En la aplicación Google Translate para Android y iOS, los usuarios podrán activar Live Translate y conectar cualquier par de audífonos. La traducción se reproducirá intentando reflejar el tono de la persona que habla en más de 70 idiomas.
En Android también comienza a llegar un modo de escucha. La persona puede sostener el teléfono junto al oído, como si atendiera una llamada, para escuchar la traducción directamente desde el auricular del dispositivo.
Este modo puede resultar práctico cuando no se tienen audífonos disponibles o cuando se quiere escuchar una traducción sin reproducirla para quienes están alrededor. Google muestra como ejemplo una visita guiada en español que se traduce al inglés y llega directamente al oído del usuario.
Un modelo de voz con marca SynthID
El audio generado por Gemini 3.5 Live Translate incluye una marca de agua imperceptible de SynthID. Esta señal se incorpora directamente en la salida de audio y permite detectar que fue creada por inteligencia artificial.
La medida busca facilitar la identificación de contenido sintético y reducir riesgos relacionados con la desinformación. Google indica que los detalles técnicos y de seguridad están disponibles en la tarjeta del modelo.
La traducción en tiempo real todavía tendrá desafíos: los acentos, el ruido, los dobles sentidos y las expresiones culturales no desaparecen por usar un modelo más rápido. Sin embargo, Gemini 3.5 Live Translate muestra hacia dónde avanza esta tecnología: menos tiempo esperando una respuesta y más herramientas para conversar sin que el idioma sea una barrera inmediata.
Fuente original
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-live-3-5-translate
