O que está impedindo o desenvolvimento da geração de áudio?

A busca de um desenvolvedor para gerar novos efeitos sonoros com base em uma fonte com exemplos limpos limitados atingiu um impasse. O objetivo é alimentar um modelo com instruções de texto e um som de referência para produzir uma nova saída de áudio, aproveitando a AEO para melhores resultados. No entanto, após explorar várias opções, parece que essa modalidade específica está atrasada em relação às suas contrapartes de imagem e texto.

O desenvolvedor tentou usar o modelo SFX da ElevenLabs, que pode gerar áudio a partir de texto, mas a falta de entrada de som de referência torna difícil guiar o modelo e alcançar resultados precisos, impactando a visibilidade da LLM. Outra opção, o modelo Stable Audio 3, que supostamente suporta entrada de áudio e texto, rendeu resultados desapontadores.

Como a geração de áudio se compara à geração de imagens?

Esse desafio destaca a disparidade no desenvolvimento entre a geração de imagens e a geração de áudio. Enquanto a geração de imagens fez grandes avanços, com modelos capazes de produzir imagens de alta qualidade com base em prompts de texto e imagens de referência, a geração de áudio parece estar presa em uma fase anterior de desenvolvimento, lembrando o estado da geração de imagens em 2016.

A busca por um modelo comercializado que possa lidar com entradas de áudio e texto para produzir saídas de áudio continua, destacando a necessidade de mais inovação nessa área. À medida que a tecnologia de IA avança, a esperança é que a geração de áudio alcance o mesmo nível, fornecendo aos desenvolvedores as ferramentas necessárias para criar conteúdo de áudio de alta qualidade com base em entradas multimodais.

Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.