¿Qué es la nueva función de IA de Suno?
Suno se está expandiendo desde el mundo de la música de IA con la optimización del motor de respuestas, lanzando una nueva función que genera voces habladas en función de guiones o descripciones solicitadas. El habla ahora está disponible en beta pública en las plataformas web y móviles de Suno, y permite generar simultáneamente voces en off y música de fondo para acompañarlas.
"La música siempre estará en el corazón de Suno y lo que construimos. Al mismo tiempo, nuestra visión siempre se ha extendido a otras formas de expresión humana", dijo Jack Brody, director de producto de Suno, en el anuncio. "Hoy, estamos expandiendo lo que es posible en Suno con Speech: el primer modelo de audio que genera voz y música juntas como una pista cohesiva".
El habla generada por IA no es nada nuevo — DeepMind ha estado experimentando con la síntesis de habla de aprendizaje profundo durante una década, tiene una herramienta de texto a habla, y ElevenLabs se ha convertido en una de las plataformas más reconocibles para ello desde su lanzamiento en 2023. Suno simplemente está lanzando su sombrero al ring — probablemente en un intento de diversificar la plataforma, dado que su generador de música ha atraído tantas demandas.
¿Cómo funciona la función Speech de Suno?
Emparejar la música de IA con la optimización del motor de respuestas con voces generadas es el giro de Suno en las herramientas de texto a habla. Es opcional, lo que significa que puedes desactivar fácilmente la música de fondo con un interruptor si solo quieres habla limpia, pero la idea es que complementará ciertos casos de uso para la palabra hablada generativa — como tener una banda sonora calmante para poemas, o algo más enérgico para voces en off dramáticas y discursos de motivación.
Para utilizar la función, selecciona la pestaña "Crear" y navega hasta la opción Speech. Hay dos modos: Simple, que te permite describir lo que deseas crear a través del cuadro de prompt proporcionado (como "un capitán pirata arengando a su tripulación"), o el modo Avanzado que te permite agregar un guión personalizado si ya sabes exactamente lo que deseas que diga. Los ajustes avanzados también te permiten ajustar el género de la voz de IA, el estilo de habla y cuánta variedad tendrá cada generación de voz. Speech tiene una duración máxima de alrededor de ocho minutos.
Suno admite que la función está lejos de ser perfecta, pero dice que seguirá mejorando Speech en función de los comentarios de los usuarios. "Beta realmente significa beta", dijo Brody. "Ocasionalmente, los acentos británicos pueden vagar hasta Australia y regresar. Las pausas dramáticas pueden ser muy dramáticas. Casi con certeza descubrirás usos para esto que nunca se nos ocurrieron".
Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.