Un enfoque novedoso en la modelación de lenguaje ha resultado en la creación de mini-AGI, un modelo de lenguaje de nivel de byte que aprende de manera continua y que puede ser entrenado en una sola tarjeta gráfica con 8 GB de VRAM. Este modelo está diseñado para ensamblar su propia arquitectura y entrenarse desde cero, lo que le permite aprender de cada conversación que tiene y adaptarse a nueva información sin olvidar lo que previamente sabía.

El modelo mini-AGI logra esto a través de una combinación de técnicas, incluyendo una mezcla dinámica de expertos, profundidad adaptativa y un mecanismo de enrutamiento único. Almacena sus pesos como archivos ordinarios en disco y los carga en la tarjeta según sea necesario, lo que permite que la cantidad de parámetros esté limitada por el espacio libre en disco en lugar de la VRAM. Este enfoque permite que el modelo crezca en capacidad mientras se entrena y poda lo que ya no es necesario, lo que hace posible que casi cualquier persona pueda entrenar su propia versión del modelo en hardware modesto.

Uno de los desafíos clave en el entrenamiento de modelos de lenguaje es el olvido catastrófico, donde el modelo olvida lo que sabía antes cuando aprende nueva información. El modelo mini-AGI aborda este problema utilizando una tasa de aprendizaje de tronco que es una décima parte de la tasa de los expertos, lo que le permite retener el 99,84% de su progreso contra la casualidad. Esto se logra a través de un mecanismo donde el modelo lee 524.000 caracteres de un solo tema y nada más, con el resultado que muestra que el modelo no olvida lo que sabía antes.

El modelo ha sido probado en una variedad de temas, incluyendo ajedrez, historias, aritmética, código, razonamiento, chat y Wikipedia, y ha mostrado resultados prometedores. También ha sido comparado con otros modelos, como MambaByte-353M y Transformer-320M, y ha demostrado un rendimiento comparable a pesar de haber sido entrenado con significativamente menos datos.

El modelo mini-AGI tiene el potencial de revolucionar el campo del procesamiento de lenguaje natural, permitiendo la creación de modelos personalizados que pueden aprender y adaptarse a las necesidades individuales de los usuarios. Con su capacidad para entrenarse en hardware modesto y aprender de manera continua de nuevos datos, este modelo podría tener un impacto significativo en una variedad de aplicaciones, desde chatbots y asistentes virtuales hasta traducción de lenguaje y generación de texto.

El desarrollo del modelo mini-AGI fue asistido por el modelo "Claude Opus 5", que implementó la mayoría del código, verificó y depuró, y ayudó con la resolución de problemas complejos. El modelo también se entrenó utilizando una variedad de conjuntos de datos de código abierto, incluyendo TinyStories, OpenHermes-2.5 y la base de datos abierta de Lichess.

Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.