Uma abordagem inovadora de modelagem de linguagem resultou na criação do mini-AGI, um modelo de linguagem de nível de byte que aprende continuamente e pode ser treinado em uma única placa de vídeo com 8 GB de VRAM. Este modelo é projetado para montar sua própria arquitetura e treinar do zero, permitindo que ele aprenda com cada conversa que tem e se adapte a novas informações sem esquecer o que sabia anteriormente.

O modelo mini-AGI alcança isso por meio de uma combinação de técnicas, incluindo uma mistura dinâmica de especialistas, profundidade adaptativa e um mecanismo de roteamento único. Ele armazena seus pesos como arquivos comuns em disco e os carrega na placa conforme necessário, permitindo que a contagem de parâmetros seja limitada pelo espaço livre em disco em vez de VRAM. Essa abordagem permite que o modelo cresça nova capacidade enquanto treina e poda o que não é mais necessário, tornando possível para quase qualquer pessoa treinar sua própria versão do modelo em hardware modesto.

Um dos principais desafios no treinamento de modelos de linguagem é o esquecimento catastrófico, onde o modelo esquece o que sabia antes quando aprende novas informações. O modelo mini-AGI aborda esse problema usando uma taxa de aprendizado de tronco que é um décimo da taxa dos especialistas, permitindo que ele retenha 99,84% de seu progresso contra a chance. Isso é alcançado por meio de um mecanismo onde o modelo lê 524.000 caracteres de um único assunto e nada mais, com o resultado mostrando que o modelo não esquece o que sabia antes.

O modelo foi testado em uma variedade de assuntos, incluindo xadrez, histórias, aritmética, código, raciocínio, bate-papo e Wikipedia, e mostrou resultados promissores. Ele também foi comparado a outros modelos, como MambaByte-353M e Transformer-320M, e demonstrou desempenho comparável apesar de ter sido treinado em significativamente menos dados.

O modelo mini-AGI tem o potencial de revolucionar o campo do processamento de linguagem natural, permitindo a criação de modelos personalizados que podem aprender e se adaptar às necessidades individuais dos usuários. Com sua capacidade de treinar em hardware modesto e aprender continuamente a partir de novos dados, esse modelo pode ter um impacto significativo em uma variedade de aplicações, desde chatbots e assistentes virtuais até tradução de linguagem e geração de texto.

O desenvolvimento do modelo mini-AGI foi assistido pelo modelo "Claude Opus 5", que implementou a maior parte do código, verificou e depurou, e ajudou a brainstormar problemas complexos. O modelo também foi treinado usando uma variedade de conjuntos de dados de código aberto, incluindo TinyStories, OpenHermes-2.5 e o banco de dados aberto do Lichess.

Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.