Os modelos de reconhecimento de fala se tornaram incrivelmente bons em transcrever áudio limpo gravado em condições controladas. Mas o ditado raramente acontece nessas condições. Milhões de pessoas usam o Wispr Flow para enviar mensagens para amigos, escrever e-mails, codar e trabalhar em ideias em suas mesas, entre reuniões, durante commutas e em escritórios movimentados. Eles falam através de microfones de laptops, fones de ouvido e fones de cabeça, muitas vezes com outras vozes, música ou trânsito ao fundo.
Hoje, o Laboratório de Interfaces Avançadas da Wispr está apresentando Canto, nosso modelo de fala mais recente para ditado em tempo real. Em uma avaliação de ditados do mundo real, Canto alcançou a taxa de erro de palavra mais baixa entre todos os modelos que testamos. Comparamos Canto com modelos da Google, OpenAI, AssemblyAI e Deepgram.
Canto é o primeiro modelo em um programa mais amplo de pesquisa e desenvolvimento no Laboratório de Interfaces Avançadas da Wispr. Neste post, compartilhamos como ele se sai, como o treinamos para lidar com condições desafiadoras do mundo real e a pesquisa que já está moldando o que vem a seguir.
Avaliar Canto em condições do mundo real exigiu criar um conjunto de avaliação composto por 10 horas de ditados em inglês do Wispr Flow de mais de 2.300 falantes únicos, amostrados aleatoriamente em aplicativos e casos de uso. Fomos cuidadosos para impor uma separação rigorosa entre os falantes representados nos conjuntos de treinamento e teste para evitar o sobreajuste em características de falante. Cada amostra veio de um usuário que optou por compartilhar seus dados com a Wispr, o que permite que seus dados sejam usados anonimamente para avaliar e melhorar nossos modelos.
Canto alcançou a taxa de erro de palavra (WER) mais baixa entre os modelos em nossa comparação. A WER mede substituições, omissões e inserções de palavras em relação a uma referência transcrita por humanos (menor é melhor). O modelo se saiu bem em dados amostrados aleatoriamente, mas também estávamos interessados em estudar seu desempenho nas situações mais desafiadoras. Construímos um conjunto de avaliação de desafio separado, de 3 horas, que apresentava as condições mais propensas a causar falha no ditado.
O conjunto inclui áudio afetado por fala próxima, música, trânsito, vento, volume de gravação baixo e fala sussurrada ou de longe. Ele também inclui ditados curtos que dão ao modelo muito pouco contexto e linguagem para ajudar a resolver ambiguidades. No conjunto de desafio completo, Canto ficou em segundo lugar atrás do Gemini 3.1 Pro, um modelo multi-modal de fronteira muito maior que não é adequado para aplicações de baixa latência em tempo real. Entre os modelos de transcrição em tempo real que avaliamos, Canto alcançou a WER mais baixa.
Examinamos ainda mais esse conjunto de dados para entender como os modelos se comportam de forma diferente. O Gemini 3.1 Pro alcançou a WER mais baixa em áudio com ruído. Canto empatou com a WER mais baixa em fala de volume baixo e ditados curtos. Ditados curtos produziram as taxas de erro mais altas na comparação. Um único erro tem um efeito maior no WER quando uma declaração contém apenas algumas palavras, e os modelos também têm menos contexto linguístico disponível para resolver ambiguidades.
Canto começa com um modelo pré-treinado em milhões de horas de fala e texto. Em seguida, treinamos Canto em duas etapas. Primeiro, mostramos a ele áudio emparelhado com transcrições de referência. O modelo aprende a prever as palavras em cada transcrição, uma etapa de cada vez. Essa etapa, chamada de ajuste fino supervisionado, ensina-o a realizar a tarefa de transcrição. Em seguida, treinamos-no para comparar a qualidade de transcrições completas. Para o mesmo áudio, o modelo gera várias transcrições possíveis. Avaliamos cada uma contra uma referência, então usamos essas avaliações para tornar transcrições melhores mais prováveis em treinamentos futuros. Isso é conhecido como aprendizado por reforço, ou RL.
A distinção está em como o modelo recebe feedback. O ajuste fino supervisionado fornece as palavras esperadas a cada etapa. O aprendizado por reforço avalia a transcrição completa (gerada pelo modelo). Isso nos permite treinar em torno dos resultados que nos importam, como reduzir erros de reconhecimento em condições de gravação desafiadoras. Nossa abordagem usa a Otimização de Política Relativa de Grupo, ou GRPO.
Canto é o primeiro modelo em uma família maior. Já estamos treinando seu sucessor em mais de dez vezes a escala de Canto, com o objetivo de melhorar o reconhecimento em condições de áudio desafiadoras, melhorar o reconhecimento de vários falantes, fazer um melhor uso do vocabulário contextual e atingir o mesmo padrão em mais idiomas. A abordagem pós-treinamento descrita aqui também nos permitirá introduzir recompensas mais especializadas e ambientes de treinamento mais difíceis à medida que os modelos crescem.
Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.