A Voice Arena e a Hugging Face anunciaram uma parceria para lançar uma avaliação aberta de reconhecimento automático de fala (ASR) para o hindi e o inglês indiano. O objetivo é ampliar a liderança do Open ASR Leaderboard, até agora dominado por idiomas europeus.

Benchmarks definem a direção do desenvolvimento de modelos. Um modelo que obtém boa pontuação na tabela é adotado e aprimorado, enquanto habilidades não mensuradas pela tabela tendem a ser ignoradas. Esforços recentes visaram tornar os indicadores de avaliação mais confiáveis, mas o erro de palavra (WER) continua sendo um único número fácil de ser manipulado.

Estudos revelaram desigualdades raciais em sistemas comerciais de ASR, com erros aproximadamente duas vezes maiores para falantes negros do que para falantes brancos. Diferenças adicionais surgem conforme gênero, idade e sotaque são considerados. Esses fatores não aparecem nos placares, não porque sejam ocultados, mas porque os conjuntos de teste registram apenas o que foi dito, sem informações sobre quem falou.

Para preencher essa lacuna, os organizadores do Open ASR Leaderboard introduziram dois novos conjuntos de avaliação: Monsoon en-IN e Monsoon hi-IN. O hindi, falado por mais de meio bilhão de pessoas, é o primeiro idioma Índico presente em uma aba multilíngue. Cada conjunto é disponibilizado em uma parte pública, aberta à autoavaliação, e em uma parte privada, mantida em sigilo para evitar ajustes excessivos ao benchmark. As quatro divisões são independentes entre os falantes e abrangem 4.888 falantes, com 12 atributos demográficos registrados para cada um.

O Monsoon foi projetado para variar ao longo de nove eixos: geografia, idade, gênero, vocabulário, dispositivos, ambientes acústicos, tipo de fala, ritmo da fala e a existência de transcrições válidas múltiplas para o mesmo áudio. Cada eixo representa uma maneira pela qual um WER agregados pode ser correto em média, mas errado para um grupo populacional específico. A coleção segue um pipeline único que gera as quatro divisões, abrangendo as duas línguas.

As gravações são provenientes de conversas espontâneas, gravadas em duplo canal e segmentadas de forma que cada clip contenha um único interlocutor. Além disso, são registrados ocupação, nível de educação, estado civil, faixa de renda, marca do aparelho e cidade atual, entre outros dados. Exemplo de clipes do conjunto público de inglês indiano inclui um recorte de uma mulher de 29 anos no distrito de West Tripura, estudante, usando um Samsung SM-G781B, um homem de 22 anos, estudante, em Rohtas, Bihar, com um motorola moto g54 5G, e várias outras combinações que ilustram a diversidade de profissão e de equipamentos.

O hindi apresenta uma variabilidade ortográfica muito maior que o inglês, e nenhum normalizador consegue resolver todas as formas, porque as variações não seguem um mapeamento fixo entre duas convenções. Por isso, os conjuntos de hindi são entregues como um grafocaminho: para cada trecho da transcrição, uma lista de grafias aceitas como corretas.É importante frisar que o Monsoon mede a diversidade em número de falantes e número de horas de áudio, e é nessa característica que reside o maior valor.

A distribuição geográfica é ampla: o conjunto público de inglês indiano abrange 428 distritos nativos em 30 estados e territórios, enquanto os conjuntos de hindi concentram-se no cinto hindi, com Uttar Pradesh respondendo por cerca de 40% dos falantes. As gravações vão captadas em 315 a 582 modelos diferentes de aparelhos, sem que qualquer modelo individual represente mais de 2,1% dos segmentos em qualquer divisão.

A divisão de inglês indiano não reflete um único sotaque regional: todas as seis zonas geográficas estão representadas, com 35% dos segmentos provenientes do sul, 18% do leste, 18% do centro, 16% do norte e 11% do oeste. Os campos demográficos estão completos ou quase completos, e os colaboradores deram consentimento para este uso.

O conjunto de hindi segue o padrão populacional esperado, enquanto o inglês indiano apresenta uma distribuição mais uniforme: nenhum estado supera 13% e um terço dos falantes vem de fora dos oito maiores estados. Tanto os arquivos públicos quanto os privados mantêm a mesma proporção, o que permite que o mesmo tipo de análise, anteriormente realizado em benchmarks fechados, possa agora ser aplicado em um conjunto de teste público da tabela.

O Monsoon fornece 18 colunas por segmento, das quais 12 são campos demográficos, enquanto a maioria dos conjuntos de ASR públicos entrega apenas um identificador, uma transcrição e uma duração. A abrangência geográfica e a diversidade de falantes permitem a realização de análises detalhadas em nível distrital, desagregadas por qualidadé do áudio, velocidade de fala, duração da utterance, gênero, idade e tipo de aparelho, ampliando a compreensão das limitações do sistema de reconhecimento.

Com informações de: Hugging Face Blog