Google presentó Gemini 3.5 Transcribe, un modelo de voz a texto diseñado para convertir audio natural en texto preciso, limpio y bien estructurado. La propuesta no se limita a reconocer palabras: también interpreta correcciones, elimina muletillas, identifica vocabulario especializado y entiende el contexto de una conversación.
¿La diferencia frente a una transcripción convencional? Si dices: “Nos vemos el martes, no, el miércoles”, el modelo puede entregar directamente una versión corregida y lista para usar.
Una transcripción pensada para conversaciones reales
Los sistemas tradicionales de reconocimiento de voz suelen tener problemas con ruido de fondo, acentos, términos técnicos o frases con interrupciones. Gemini 3.5 Transcribe busca resolver estos obstáculos procesando el audio de una forma más inteligente.
Entre sus funciones principales se encuentran:
- Limpieza automática del discurso: elimina palabras de relleno como “eh” y “este”, además de organizar el texto.
- Correcciones en tiempo real: reconoce autocorrecciones y conserva la intención final del hablante.
- Vocabulario personalizado: permite adaptar el modelo a nombres propios, códigos postales, identificadores de pedidos y términos técnicos.
- Más de 85 idiomas: detecta idiomas de forma automática y trabaja con acentos regionales y dialectos diversos.
- Identificación de participantes: en audios pregrabados puede atribuir intervenciones y añadir marcas de tiempo para hasta tres hablantes. El soporte para más participantes todavía es experimental.
Esto puede ser útil en escenarios muy distintos: desde una aplicación de subtítulos en vivo hasta el análisis posterior de llamadas de atención al cliente. También abre la puerta a asistentes de voz que no solo transcriben, sino que entienden qué debe ocurrir después.
Dos APIs para casos de uso diferentes
Google ofrece Gemini 3.5 Transcribe mediante dos interfaces dentro de sus plataformas para desarrolladores.
Transcripción en tiempo real
La API Live permite transmisión bidireccional continua con latencia inferior a un segundo mediante el modelo gemini-3.5-transcribe-live. Está pensada para agentes de voz, subtítulos instantáneos y aplicaciones interactivas donde esperar varios segundos puede romper la experiencia.
Procesamiento de audio pregrabado
La Interactions API utiliza gemini-3.5-transcribe para procesar reuniones, llamadas, entrevistas y otros archivos de audio. En este modo ofrece atribución de hablantes y marcas de tiempo a nivel de palabra, recursos importantes para análisis de conversaciones y búsquedas dentro de grabaciones.
La diferencia práctica es sencilla: una API acompaña la conversación mientras ocurre y la otra analiza el audio después de que termina.
Precisión, velocidad y resultados medibles
Según mediciones de Artificial Analysis, Gemini 3.5 Transcribe alcanza una tasa promedio de error de palabras, conocida como WER, de 4,0 % en streaming y 2,6 % en escenarios no interactivos. Mientras menor es este porcentaje, menos palabras se transcriben de forma incorrecta.
El modelo también mejora frente a Chirp 3, el sistema anterior de Google. La compañía afirma que el tiempo hasta obtener la transcripción final se redujo en 70 %.
En el benchmark multilingüe FLEURS, Gemini 3.5 Transcribe registró un WER de 5,50 % en streaming y 5,04 % en procesamiento no streaming en un conjunto de idiomas y regiones principales. Estos resultados ayudan a dimensionar el avance, aunque el rendimiento real puede cambiar según el ruido, la calidad del micrófono, el idioma y la cantidad de voces presentes.
Del dictado a las acciones con inteligencia artificial
La apuesta de Google no termina en escribir lo que una persona dice. Gemini 3.5 Transcribe puede servir como punto de entrada para ejecutar tareas mediante la voz, especialmente cuando se combina con otros modelos Gemini a través de function calling.
Por ejemplo, en la aplicación Gemini para macOS, una persona puede hablar de manera natural, pedir un resumen de archivos locales, reutilizar un texto en otra aplicación o solicitar la generación de una imagen. El modelo de transcripción interpreta la instrucción y delega las tareas complejas a otros sistemas.
Esta evolución cambia la idea de dictado. Ya no se trata únicamente de convertir voz en texto, sino de usar la voz como una interfaz para trabajar con documentos, aplicaciones y agentes digitales.
Integración en productos de Google
Google también está incorporando el modelo en varias experiencias propias:
- Gboard en Android: la función Rambler transforma pensamientos hablados en texto con formato, elimina muletillas y permite corregir errores o cambiar el estilo usando la voz.
- Google Antigravity: utiliza, con permiso del usuario, el contexto de la pantalla y el historial del chat para mejorar la transcripción de nombres de archivos, documentos y procesos activos.
- Google AI Studio: permite usar la voz en el modo Build para crear aplicaciones mediante instrucciones habladas.
- Gemini en macOS: combina transcripción, contexto de pantalla y comandos de voz para automatizar flujos de trabajo.
- Chrome: Google prepara una función para dictar texto en cualquier campo de la web, desde respuestas hasta publicaciones y solicitudes para Gemini.
La clave está en el contexto. Una misma palabra puede significar algo distinto según el archivo abierto, la aplicación utilizada o la conversación previa. Un modelo capaz de considerar esas señales puede producir resultados más útiles que un transcriptor aislado.
Disponibilidad para desarrolladores y empresas
Gemini 3.5 Transcribe está disponible en vista previa pública para desarrolladores mediante la Gemini API, Google AI Studio y Google Antigravity. También llega a Gemini Enterprise Agent Platform, mientras que su disponibilidad para Gemini Enterprise for Customer Experience está prevista próximamente.
Plataformas como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents ya trabajan con la Live API para facilitar la creación de interfaces de voz. Estas herramientas se encargan de parte de la infraestructura de streaming, mientras los equipos pueden concentrarse en diseñar la experiencia del usuario.
Para el público general, el modelo está disponible en la aplicación Gemini para macOS en inglés y en Rambler para Android en determinados países e idiomas. La integración con Chrome llegará más adelante.
Gemini 3.5 Transcribe muestra hacia dónde se mueve la interacción con la IA: hablar de forma natural, corregirse sobre la marcha y esperar que el sistema entienda la intención completa. La tecnología todavía depende de factores como el idioma, el ruido y la privacidad del contexto, pero la frontera entre dictar una instrucción y ejecutar una tarea empieza a ser cada vez más pequeña.
Fuente original
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe
