Google apresentou o Gemini 3.5 Transcribe como a mais recente adição à sua família Gemini Audio, marcando um passo significativo em direção à transcrição impulsionada por inteligência artificial. O modelo — descrito pela empresa como uma grande atualização em relação ao seu sistema Chirp 3 anterior — oferece suporte multilíngue para mais de 85 idiomas e pode inteligentemente filtrar sons de enchimento, como "hum" e "ah". Ele também formata o texto em tempo real, permitindo que os usuários editem documentos usando apenas sua voz.

Uma das funcionalidades mais destacadas é a capacidade de ingerir um vocabulário personalizado. Organizações que dependem de terminologia específica da indústria podem carregar suas próprias listas de palavras, garantindo que o modelo retorne a grafia correta e evite edições indesejadas. Na prática, isso significa que escritórios de advocacia, pesquisadores médicos e equipes técnicas podem ditar sem ter que corrigir constantemente jargões após o fato.

Além da simples dictação, o Gemini 3.5 Transcribe fornece marcações de tempo em nível de palavra e pode atribuir fala a até três falantes distintos em um clipe pré-gravado. Essa capacidade abre caminho para uma edição de podcast mais rápida, geração de atas de reuniões e transcrição de entrevistas com vários falantes sem rotulagem manual de falantes.

O lançamento começa hoje para usuários de língua inglesa do aplicativo Gemini para macOS e da funcionalidade de dictação Rambler no Android em mercados selecionados. Desenvolvedores interessados em acesso antecipado podem explorar o modelo por meio de uma visualização pública na API Gemini, disponível via AI Studio e Antigravity. A Google também sugeriu que a integração com o Chrome está no horizonte, embora não tenha fornecido uma data.

A Google originalmente sugeriu uma suíte Gemini 3.5 mais ampla, incluindo modelos Live e Live Experimental que melhorariam a tradução em tempo real e o processamento visual. Após a publicação, a empresa esclareceu que apenas o modelo Transcribe está sendo lançado neste momento, adiando as outras variantes.

Observadores da indústria notam que a nova ferramenta de transcrição pode fortalecer a posição da Google no mercado de reconhecimento de fala empresarial, onde concorrentes como Microsoft e Amazon oferecem soluções de nicho há muito tempo. Ao combinar desempenho multilíngue robusto com atribuição de falante e vocabulários personalizados, o Gemini 3.5 Transcribe se posiciona como uma opção versátil para usuários tanto consumidores quanto profissionais.

O anúncio da Google chega em um momento em que as empresas estão cada vez mais dependentes da entrada de voz para otimizar fluxos de trabalho e reduzir a digitação manual. Com a capacidade de produzir transcrições mais limpas e precisas diretamente, o modelo Gemini 3.5 Transcribe pode reduzir o tempo gasto em pós-processamento e melhorar a produtividade geral.

Embora a empresa não tenha divulgado preços, a funcionalidade está atualmente disponível sem custo adicional para usuários existentes do aplicativo Gemini. Atualizações futuras, incluindo o suporte ao Chrome prometido, podem ampliar sua abrangência para uma audiência mais ampla de usuários baseados na web.

Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.