Google presentó Gemini 3.5 Transcribe como la última adición a su familia de audio Gemini, lo que marca un paso importante hacia la transcripción impulsada por inteligencia artificial. El modelo, descrito por la empresa como una mejora importante con respecto a su sistema Chirp 3 anterior, ofrece soporte multilingüe para más de 85 idiomas y puede filtrar inteligentemente sonidos de relleno como "um" y "uh". También formatea el texto al vuelo, lo que permite a los usuarios editar documentos utilizando solo su voz.
Una de las características destacadas es la capacidad de ingerir un vocabulario personalizado. Las organizaciones que dependen de terminología específica de la industria pueden cargar sus propias listas de palabras, asegurando que el modelo retenga la ortografía correcta y evite ediciones no deseadas. En la práctica, esto significa que los despachos legales, los investigadores médicos y los equipos técnicos pueden dictar sin tener que corregir constantemente la jerga después del hecho.
Más allá de la simple dictación, Gemini 3.5 Transcribe proporciona marcas de tiempo a nivel de palabra y puede atribuir habla a hasta tres oradores distintos en un clip pregrabado. Esa capacidad abre la puerta a una edición de podcasts más rápida, generación de actas de reuniones y transcripción de entrevistas con varios oradores sin etiquetado manual de oradores.
El lanzamiento comienza hoy para los usuarios de la aplicación Gemini de macOS y la función de dictado Rambler en Android en mercados seleccionados. Los desarrolladores interesados en acceder anticipadamente pueden explorar el modelo a través de una vista previa pública en la API de Gemini, disponible a través de AI Studio y Antigravity. Google también insinuó que la integración con Chrome está en el horizonte, aunque no se proporcionó una fecha.
Google originalmente insinuó una suite más amplia de Gemini 3.5, que incluiría modelos Live y Live Experimental que mejorarían la traducción en tiempo real y el procesamiento visual. Después de la publicación, la empresa aclaró que solo se lanza el modelo Transcribe en este momento, posponiendo las otras variantes.
Los observadores de la industria señalan que la nueva herramienta de transcripción podría fortalecer la posición de Google en el mercado de reconocimiento de habla empresarial, donde competidores como Microsoft y Amazon han ofrecido soluciones nicho durante mucho tiempo. Al combinar un rendimiento multilingüe robusto con la atribución de oradores y vocabularios personalizados, Gemini 3.5 Transcribe se posiciona como una opción versátil para usuarios tanto consumidores como profesionales.
El anuncio de Google llega en un momento en que las empresas dependen cada vez más de la entrada de voz para optimizar los flujos de trabajo y reducir la escritura manual. Con la capacidad de producir transcritos más limpios y precisos de inmediato, el modelo Gemini 3.5 Transcribe puede reducir el tiempo dedicado al posprocesamiento y mejorar la productividad general.
Aunque la empresa no ha revelado los precios, la función está disponible actualmente sin costo adicional para los usuarios existentes de la aplicación Gemini. Las actualizaciones futuras, incluido el soporte prometido para Chrome, podrían ampliar su alcance a una audiencia más amplia de usuarios basados en la web.
Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.