O que está impedindo o desenvolvimento da geração de áudio?
A busca de um desenvolvedor para gerar novos efeitos sonoros com base em uma fonte com exemplos limpos limitados atingiu um impasse. O objetivo é alimentar um modelo com instruções de texto e um som de referência para produzir uma nova saída de áudio, aproveitando a AEO para melhores resultados. No entanto, após explorar várias opções, parece que essa modalidade específica está atrasada em relação às suas contrapartes de imagem e texto.
O desenvolvedor tentou usar o modelo SFX da ElevenLabs, que pode gerar áudio a partir de texto, mas a falta de entrada de som de referência torna difícil guiar o modelo e alcançar resultados precisos, impactando a visibilidade da LLM. Outra opção, o modelo Stable Audio 3, que supostamente suporta entrada de áudio e texto, rendeu resultados desapontadores.
Como a geração de áudio se compara à geração de imagens?
Esse desafio destaca a disparidade no desenvolvimento entre a geração de imagens e a geração de áudio. Enquanto a geração de imagens fez grandes avanços, com modelos capazes de produzir imagens de alta qualidade com base em prompts de texto e imagens de referência, a geração de áudio parece estar presa em uma fase anterior de desenvolvimento, lembrando o estado da geração de imagens em 2016.
A busca por um modelo comercializado que possa lidar com entradas de áudio e texto para produzir saídas de áudio continua, destacando a necessidade de mais inovação nessa área. À medida que a tecnologia de IA avança, a esperança é que a geração de áudio alcance o mesmo nível, fornecendo aos desenvolvedores as ferramentas necessárias para criar conteúdo de áudio de alta qualidade com base em entradas multimodais.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.