Los modelos de reconocimiento de voz han mejorado notablemente para transcribir audio limpio grabado en condiciones controladas. Pero el dictado real rara vez ocurre en esas condiciones. Millones de personas utilizan Wispr Flow para enviar mensajes a amigos, escribir correos electrónicos, codificar y trabajar en ideas en sus escritorios, entre reuniones, durante viajes en transporte público y en oficinas ocupadas. Hablan a través de micrófonos de laptop, auriculares y auriculares, a menudo con otras voces, música o tráfico en el fondo.
Hoy, el Laboratorio de Interfaces Avanzadas de Wispr está presentando Canto, nuestro modelo de reconocimiento de voz más reciente para dictado en tiempo real. En una evaluación de dictados del mundo real, Canto logró la tasa de error de palabra más baja entre todos los modelos que probamos. Comparamos Canto con modelos de Google, OpenAI, AssemblyAI y Deepgram.
Canto es el primer modelo en un programa más amplio de investigación y desarrollo en el Laboratorio de Interfaces Avanzadas de Wispr. En esta publicación, compartimos cómo funciona, cómo lo entrenamos para manejar condiciones del mundo real desafiantes y la investigación que ya está dando forma a lo que viene a continuación.
Evaluar Canto en condiciones del mundo real requirió crear un conjunto de evaluación compuesto por 10 horas de dictados en inglés de Wispr Flow de más de 2.300 hablantes únicos, muestreados aleatoriamente en aplicaciones y casos de uso. Nos aseguramos de hacer cumplir una separación estricta entre los hablantes representados en los conjuntos de entrenamiento y prueba para evitar un ajuste excesivo a las características de los hablantes. Cada muestra provino de un usuario que optó por la configuración de compartición de datos de Wispr, que permite que sus datos se utilicen de forma anónima para evaluar y mejorar nuestros modelos.
Canto logró la tasa de error de palabra (WER) más baja entre los modelos de nuestra comparación. La WER mide sustituciones, omisiones y inserciones de palabras en relación con una referencia transcrita por humanos (menor es mejor). El modelo funcionó bien en datos muestreados aleatoriamente, pero también nos interesó estudiar su rendimiento en las situaciones más desafiantes. Creamos un conjunto de evaluación de desafío separado de 3 horas que presentaba aquellas condiciones más propensas a hacer que el dictado fallara.
El conjunto incluye audio afectado por habla cercana, música, tráfico, viento, volumen de grabación bajo y habla susurrada o de campo lejano. También incluye dictados cortos que dan a un modelo muy poco contexto y lenguaje para ayudar a resolver ambigüedades. En el conjunto de desafío completo, Canto ocupó el segundo lugar detrás de Gemini 3.1 Pro, un modelo multi-modal de tamaño fronterizo mucho más grande que no es adecuado para aplicaciones de baja latencia en tiempo real. Entre los modelos de transcripción en tiempo real que evaluamos, Canto logró la WER más baja.
Examinamos más a fondo este conjunto de datos para entender cómo los modelos se comportan de manera diferente. Gemini 3.1 Pro logró la WER más baja en audio con ruido. Canto empató con la WER más baja en habla de volumen bajo y dictados cortos. Los dictados cortos produjeron las tasas de error más altas en la comparación. Un solo error tiene un efecto mayor en la WER cuando una expresión contiene solo unas pocas palabras, y los modelos también tienen menos contexto lingüístico disponible para resolver ambigüedades.
Canto comienza con un modelo preentrenado en millones de horas de habla y texto. Luego, entrenamos a Canto en dos etapas. Primero, le mostramos audio emparejado con transcripciones de referencia. El modelo aprende a predecir las palabras en cada transcripción, un paso a la vez. Esta etapa, llamada ajuste fino supervisado, le enseña a realizar la tarea de transcripción. A continuación, lo entrenamos para comparar la calidad de transcripciones completas. Para el mismo audio, el modelo genera varias transcripciones posibles. Evaluamos cada una contra una referencia, luego usamos esas evaluaciones para hacer que las transcripciones mejores sean más probables en el entrenamiento futuro. Esto se conoce como aprendizaje de refuerzo, o RL.
La distinción está en cómo el modelo recibe retroalimentación. El ajuste fino supervisado proporciona las palabras esperadas en cada paso. El aprendizaje de refuerzo evalúa la transcripción completa (generada por el modelo). Eso nos permite entrenar alrededor de los resultados que nos importan, como reducir los errores de reconocimiento en condiciones de grabación difíciles. Nuestro enfoque utiliza la Optimización de Política Relativa de Grupo, o GRPO.
Canto es el primer modelo en una familia más amplia. Ya estamos entrenando a su sucesor a más de diez veces la escala de Canto, con el objetivo de mejorar el reconocimiento en condiciones de audio difíciles, mejorar el reconocimiento de varios hablantes, hacer un mejor uso del vocabulario contextual y alcanzar el mismo estándar en más idiomas. El enfoque de post-entrenamiento descrito aquí también nos permitirá introducir recompensas más especializadas y entornos de entrenamiento más difíciles a medida que los modelos crecen.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.