Google anunciou o lançamento de dois novos modelos de texto para fala, Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, projetados para transformar a geração de voz em um estúdio criativo dinâmico. Esses modelos permitem que criadores, desenvolvedores e empresas criem experiências de áudio mais expressivas com melhorias na experiência do usuário em produtos como Gemini Notebook e Google Vids.
Gemini 3.8 Flash TTS é construído para direção criativa profunda e design de personagens, permitindo que os usuários criem vozes completamente novas do zero usando prompts de linguagem natural. Esse modelo fornece controle granular sobre dicas de atuação, ritmo, mudanças de dialeto e backchanneling, tornando-o ideal para jogos, livros de áudio imersivos, podcasts e mídia interativa.
Gemini 3.8 Flash-Lite TTS, por outro lado, é otimizado para escala de alto volume e eficiência de custo, tornando-o adequado para dublagem de alto volume, criação de conteúdo de áudio e agentes de voz expressivos. Ambos os modelos complementam a família de áudio Gemini de rápido crescimento da Google, que inclui 3.5 Live Translate, 3.5 Transcribe, 3.8 Live e 3.8 Live Extended Thinking.
Com o Gemini 3.8 Flash TTS, os usuários podem criar e personalizar suas próprias vozes, escalando de 30 vozes originais para uma biblioteca infinita. O modelo também permite o design de voz gerativo, permitindo que os usuários criem vozes personalizadas do zero, personalizando papel, sotaque e características de voz em mais de 100 idiomas e dialetos usando prompts de linguagem natural.
O modelo Gemini 3.8 Flash TTS conquistou o 1º lugar geral no Voice Design Benchmark da Hume AI e também lidera no modelo de sotaque. Em avaliações de preferência humana cega no Voice Arena, Gemini 3.8 Flash e Flash-Lite TTS conquistaram posições de liderança entre os concorrentes em idiomas globais importantes, incluindo japonês, português brasileiro, vietnamita, árabe moderno padrão, espanhol mexicano e hindi.
Google construiu suas capacidades de criação e replicação de voz com salvaguardas rigorosas para proteger o talento de voz, respeitar a identidade e garantir a transparência do conteúdo. A empresa também introduziu um novo playground de áudio, Google AI Studio, onde os desenvolvedores podem experimentar as novas capacidades de geração de fala e implantar interfaces de voz de alto desempenho com facilidade.
Cet article a été rédigé avec l'assistance de l'IA.
News Factory APP - actualités agentiques pour booster votre SEO et AEO.