Google ha anunciado el lanzamiento de dos nuevos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, diseñados para transformar la generación de voz en un estudio creativo dinámico. Estos modelos permiten a los creadores, desarrolladores y empresas crear experiencias de audio más expresivas con mejoras en la experiencia del usuario en productos como Gemini Notebook y Google Vids.
Gemini 3.8 Flash TTS está construido para una dirección creativa profunda y diseño de personajes, lo que permite a los usuarios crear voces completamente nuevas desde cero utilizando prompts de lenguaje natural. Este modelo proporciona un control granular sobre las señales de actuación, el ritmo, los cambios de dialecto y la retroalimentación, lo que lo hace ideal para juegos, audiolibros inmersivos, podcasts y medios interactivos.
Gemini 3.8 Flash-Lite TTS, por otro lado, está optimizado para una escalabilidad de alto volumen y costo eficiente, lo que lo hace adecuado para doblaje de alto volumen, creación de contenido de audio y agentes de voz expresivos. Ambos modelos complementan la familia de audio Gemini de Google en crecimiento rápido, que incluye 3.5 Live Translate, 3.5 Transcribe, 3.8 Live y 3.8 Live Extended Thinking.
Con Gemini 3.8 Flash TTS, los usuarios pueden crear y personalizar sus propias voces, escalando desde 30 voces originales hasta una biblioteca infinita. El modelo también permite el diseño de voz generativo, lo que permite a los usuarios crear voces personalizadas desde cero personalizando el papel, el acento y las características de la voz en más de 100 idiomas y dialectos utilizando la inducción de lenguaje natural.
El modelo Gemini 3.8 Flash TTS ha asegurado el puesto #1 en general en el benchmark de diseño de voz de Hume AI y también lidera en la modelización de acentos. En evaluaciones de preferencia humana ciega en Voice Arena, Gemini 3.8 Flash y Flash-Lite TTS han asegurado posiciones destacadas entre los competidores en idiomas globales clave, incluyendo japonés, portugués brasileño, vietnamita, árabe moderno standard, español mexicano e hindi.
Google ha construido sus capacidades de creación y replicación de voz con salvaguardas estrictas para proteger el talento de voz, respetar la identidad y garantizar la transparencia del contenido. La empresa también ha introducido un nuevo patio de juegos de audio, Google AI Studio, donde los desarrolladores pueden experimentar las nuevas capacidades de generación de habla y desplegar interfaces de voz de alto rendimiento con facilidad.
This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.