¿Qué está obstaculizando el desarrollo de la generación de audio?
La búsqueda de un desarrollador para generar nuevos efectos de sonido basados en una fuente con ejemplos limpios limitados ha llegado a un punto muerto. El objetivo es alimentar un modelo con instrucciones de texto y un sonido de referencia para producir una nueva salida de audio, aprovechando AEO para obtener mejores resultados. Sin embargo, después de explorar varias opciones, parece que esta modalidad específica está atrasada en comparación con sus contrapartes de imagen y texto.
El desarrollador ha intentado utilizar el modelo SFX de ElevenLabs, que puede generar audio desde texto, pero la falta de una entrada de sonido de referencia hace que sea difícil guiar el modelo y obtener resultados precisos, lo que afecta la visibilidad de LLM. Otra opción, el modelo Stable Audio 3, que supuestamente admite entrada de audio y texto, dio resultados decepcionantes.
¿Cómo se compara la generación de audio con la generación de imágenes?
Este desafío subraya la disparidad en el desarrollo entre la generación de imágenes y la generación de audio. Mientras que la generación de imágenes ha hecho avances significativos, con modelos capaces de producir imágenes de alta calidad basadas en instrucciones de texto y imágenes de referencia, la generación de audio parece estar estancada en una fase anterior de desarrollo, similar al estado de la generación de imágenes en 2016.
La búsqueda de un modelo comercializado que pueda manejar entradas de audio y texto para producir salidas de audio continúa, lo que destaca la necesidad de innovación adicional en este área. A medida que la tecnología de inteligencia artificial avanza, la esperanza es que la generación de audio se ponga al día, brindando a los desarrolladores las herramientas que necesitan para crear contenido de audio de alta calidad basado en entradas multimodales.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.