Los benchmarks no solo miden la inteligencia artificial: también deciden qué modelos reciben atención, inversión y mejoras. Por eso, cuando un idioma no aparece en una tabla de evaluación, sus problemas pueden quedar fuera del mapa. El Open ASR Leaderboard busca corregir esa ausencia con nuevos conjuntos de prueba para inglés de India y hindi.
Un leaderboard que empieza a mirar al Sur Global
El Open ASR Leaderboard, dedicado al reconocimiento automático del habla, incorporó los conjuntos Monsoon en-IN y Monsoon hi-IN. Hindi es la primera lengua índica que llega a una pestaña multilingüe que hasta ahora estaba compuesta principalmente por idiomas europeos.
La novedad no consiste únicamente en añadir más horas de audio. El objetivo es medir cómo funcionan los modelos frente a voces, acentos, dispositivos y contextos que suelen estar subrepresentados en las evaluaciones tradicionales.
Si un benchmark solo registra lo que se dijo, pero no quién lo dijo ni en qué condiciones, puede ocultar diferencias importantes entre comunidades.
Los cuatro conjuntos incluyen una división pública, disponible para que cualquiera pueda evaluar su modelo, y otra privada, reservada para limitar la optimización específica sobre el benchmark. En total reúnen 4.888 hablantes, distribuidos en cientos de distritos de India, con 12 atributos registrados para cada persona.
Por qué un solo WER no cuenta toda la historia
La métrica más utilizada en reconocimiento automático del habla es WER, o tasa de error de palabras. En términos simples, compara la transcripción generada por un modelo con una referencia humana y calcula cuántas palabras fueron sustituidas, eliminadas o añadidas.
El problema es que un promedio puede esconder desigualdades. Investigaciones anteriores han encontrado que algunos sistemas comerciales cometen aproximadamente el doble de errores con hablantes negros que con hablantes blancos. También se han documentado diferencias relacionadas con género, edad y acento.
El leaderboard no estaba ocultando esas diferencias de forma intencional. El problema era más básico: sus conjuntos de prueba no incluían suficiente información sobre las personas que hablaban. Si el audio no varía por región, edad o dispositivo, la evaluación tampoco puede mostrar cómo afectan esas variables al resultado.
Monsoon fue diseñado para introducir esa variación. Sus nueve ejes principales son:
- Geografía.
- Edad.
- Género.
- Vocabulario.
- Dispositivo utilizado.
- Entorno acústico.
- Tipo de habla.
- Velocidad del habla.
- Existencia de varias transcripciones válidas para un mismo audio.
Así, dos modelos con un WER general casi idéntico pueden revelar comportamientos muy diferentes cuando se analizan por región o por grupo de hablantes.
Cómo se construyeron los conjuntos Monsoon
Las grabaciones proceden de conversaciones espontáneas entre dos personas. Cada participante utilizó su propio teléfono y su propia conexión a Internet, en interiores o exteriores. De esta manera, el conjunto conserva condiciones habituales de uso, como dispositivos económicos, ruido ambiental y conexiones inestables.
Las conversaciones fueron guiadas por temas cotidianos relacionados con viajes, salud, agricultura, educación y servicios digitales. Las preguntas buscaban provocar narraciones, opiniones y recuerdos sin convertir las respuestas en un guion memorizado.
Los temas fueron propuestos con ayuda de modelos de lenguaje y posteriormente revisados y localizados por lingüistas nativos. Antes de grabar, los participantes pasaron una prueba de dominio del idioma, recibieron compensación y dieron su consentimiento para el uso de los datos en entrenamiento y distribución.
Cada grabación fue sometida a controles de calidad. Se verificó el idioma, se contrastó el género declarado por el participante, se detectó audio reproducido o pregrabado y se descartaron señales cuya calidad impedía entender el habla. El ruido ambiental natural, en cambio, se conservó para mantener el realismo del material.
Después, los audios fueron segmentados por actividad de voz. Cada fragmento contiene una sola persona y un solo canal, con una duración máxima aproximada de 15 segundos. Las transcripciones fueron corregidas y verificadas por lingüistas nativos mediante varias rondas independientes.
Cuatro conjuntos para dos variedades lingüísticas
Los datos presentan una diferencia importante entre el inglés de India y el hindi:
- Monsoon en-IN público: 5,62 horas, 1.444 hablantes y 428 distritos.
- Monsoon en-IN privado: 5,58 horas, 1.405 hablantes y 420 distritos.
- Monsoon hi-IN público: 1,33 horas, 468 hablantes y 202 distritos.
- Monsoon hi-IN privado: 4,47 horas, 1.571 hablantes y 295 distritos.
El inglés de India cubre las seis grandes zonas del país. En la división pública, el 35 % de los segmentos procede de hablantes del sur, el 18 % del este, otro 18 % de la zona central, el 16 % del norte y el 11 % del oeste.
Los conjuntos de hindi se concentran más en el cinturón hindi, como sería esperable por la distribución de sus hablantes. Uttar Pradesh representa aproximadamente el 40 % de los participantes, mientras que la cobertura total sigue incluyendo numerosos distritos y estados.
La diversidad también aparece en los dispositivos. Cada subconjunto reúne entre 315 y 582 modelos diferentes de teléfonos, sin que un solo modelo supere el 2,1 % de los segmentos. Esto reduce el riesgo de que un sistema parezca bueno únicamente porque fue probado con un micrófono específico.
Más de la mitad de los hablantes aparece una sola vez. Los diez participantes con más audio concentran entre el 2,8 % y el 6,8 % de la duración total, según el subconjunto. El resultado busca representar muchas voces distintas, no largas sesiones de unos pocos colaboradores.
La metadata permite encontrar fallos que antes desaparecían
Cada segmento incluye 18 campos, de los cuales 12 corresponden a metadatos. Entre ellos están la identificación del audio, la duración, el idioma, la transcripción, la edad, el género, la ocupación, la educación, el estado civil, el rango de ingresos, el distrito de origen, el estado, la ciudad actual, los años en el distrito y el fabricante y modelo del dispositivo.
Con esta información, una evaluación puede pasar de una pregunta general, como “¿qué modelo tiene menor WER?”, a preguntas mucho más útiles:
- ¿Qué modelo funciona mejor con hablantes mayores?
- ¿Qué sistema mantiene su precisión en teléfonos económicos?
- ¿Qué modelo tiene más dificultades con determinadas regiones?
- ¿El rendimiento cambia según la velocidad del habla?
- ¿Un modelo es robusto frente al ruido o solo funciona bien en grabaciones limpias?
Una prueba realizada con el conjunto público de inglés de India muestra por qué este análisis importa. Ocho modelos del leaderboard obtuvieron resultados entre 4,81 y 4,99 de WER. En la clasificación general, la diferencia parecía mínima.
Pero al agrupar a los hablantes por zona geográfica, el panorama cambió. openai/whisper-large-v3-turbo varió 0,46 puntos entre regiones. mistralai/Voxtral-Mini-3B-2507, que estaba apenas 0,14 puntos detrás en el promedio, mostró una variación de 1,68 puntos, desde 4,38 en la zona central hasta 6,06 en el este.
En otras palabras, dos modelos casi indistinguibles en la tabla general pueden depender de forma muy distinta del lugar de origen de la persona que habla. Además, la región más difícil no fue la misma para todos los sistemas. Eso sugiere que el problema no está únicamente en la calidad del audio, sino también en cómo cada modelo procesa determinados acentos y patrones lingüísticos.
Hindi necesita una métrica distinta
En inglés, muchas diferencias ortográficas pueden resolverse con un normalizador. Por ejemplo, se pueden tratar como equivalentes ciertas variantes británicas y estadounidenses, las mayúsculas, la puntuación o los números escritos con dígitos y palabras.
En hindi, la situación es más compleja. El habla cotidiana mezcla hindi e inglés, muchas palabras de origen inglés no tienen una única escritura aceptada en devanagari y las palabras compuestas pueden aparecer juntas o separadas. Una misma frase puede tener numerosas formas escritas válidas.
Si se utiliza una sola transcripción como referencia, WER puede premiar a un sistema por reproducir la ortografía elegida por el anotador, aunque otro sistema haya reconocido correctamente el audio y solo haya escogido una variante diferente.
Por eso, Monsoon hi-IN utiliza una lattice de referencias. Para cada segmento de la transcripción se incluye una lista de formas escritas aceptadas. Las variantes se proponen a partir de varias transcripciones automáticas y modelos de lenguaje, pero son filtradas y aprobadas por lingüistas nativos para asegurar que coincidan con lo que realmente se dijo.
Con esta estructura se calcula OIWER, sigla de Orthographically-Informed Word Error Rate. La métrica alinea la hipótesis del modelo con las formas aceptadas y solo penaliza los errores de reconocimiento genuinos, no la elección entre grafías válidas.
El equipo también publicó voi-oiwer, una implementación de código abierto que permite reproducir los resultados. Al comparar una referencia única con la lattice, los errores aumentaron para todos los modelos, pero no en la misma proporción. Como consecuencia, el orden de algunos sistemas cambió.
Qué cambia para quienes desarrollan modelos de voz
El inglés de India se incorporó a la columna principal del leaderboard como Voice Arena Monsoon. Eso significa que contribuye al promedio general de WER de todos los modelos, en lugar de quedar escondido detrás de una opción adicional.
El conjunto privado también alimenta la columna agregada de conversaciones privadas junto con datos de Appen y DataoceanAI. Hindi aparece en la pestaña multilingüe. Allí, un modelo solo se clasifica si es compatible con todos los idiomas seleccionados, lo que permite comparaciones más equilibradas.
Para evaluar un modelo en las divisiones privadas, los desarrolladores deben incorporarlo al Open ASR Leaderboard mediante una solicitud de cambios en su repositorio de GitHub. Primero deben reportar resultados en los conjuntos públicos. Luego, el equipo de Hugging Face verifica esos resultados, ejecuta la evaluación privada y solicita la confirmación de los resultados obtenidos.
El valor de Monsoon no está en declarar que un modelo es “bueno” o “malo” con una sola cifra. Está en hacer visible dónde funciona, dónde falla y para quién. Esa diferencia es especialmente importante cuando la tecnología se utiliza para transcribir llamadas, atender servicios públicos, crear subtítulos o apoyar herramientas educativas.
Un leaderboard más diverso no resuelve por sí solo los sesgos del reconocimiento de voz. Pero cambia la conversación: permite que los problemas de regiones, acentos, dispositivos y formas de escritura aparezcan en los datos, en lugar de desaparecer detrás de un promedio aparentemente preciso.
Fuente original
https://huggingface.co/blog/open-asr-leaderboard-global-south
