Um pequeno modelo transformer treinado do zero em 1,5 hora alcançou uma pontuação de 44% no benchmark ARC-1, superando muitos modelos de linguagem maiores. O modelo utiliza uma combinação de técnicas, incluindo treinamento supervisionado, embeddings 3D RoPE e permutações diédricas para alcançar resultados de ponta.
O benchmark ARC-1 é um benchmark de metaaprendizado que testa a capacidade de um modelo de aprender e raciocinar sobre conceitos abstratos. Ele consiste em um conjunto de puzzles de treinamento e um conjunto de puzzles de avaliação, cada um com pares de exemplos e pares de teste. O modelo é treinado nos puzzles de treinamento e avaliado nos puzzles de avaliação.
O pequeno modelo transformer foi treinado usando uma abordagem de treinamento supervisionado, onde o modelo é treinado apenas nos tokens de saída. Essa abordagem tem se mostrado mais eficaz do que o treinamento não supervisionado, onde o modelo é treinado em ambos os tokens de entrada e saída.
O modelo também utiliza embeddings 3D RoPE, que são um tipo de embedding posicional que leva em conta as relações espaciais entre os tokens. Isso permite que o modelo entenda melhor a estrutura dos dados de entrada e faça previsões mais precisas.
Além dos embeddings 3D RoPE, o modelo também utiliza permutações diédricas, que são um tipo de aumento que envolve rotacionar e refletir os dados de entrada. Isso ajuda a aumentar a diversidade dos dados de treinamento e melhorar a capacidade do modelo de generalizar para novas situações.
O pequeno modelo transformer se mostrou altamente eficaz, alcançando uma pontuação de 44% no benchmark ARC-1. Isso é impressionante, considerando que o modelo foi treinado do zero em apenas 1,5 hora. O desempenho do modelo também é comparável ao de modelos de linguagem maiores, que foram treinados em conjuntos de dados muito maiores e têm muitos mais parâmetros.
A Importância da Eficiência de Sample
O desempenho do pequeno modelo transformer no benchmark ARC-1 destaca a importância da eficiência de sample no aprendizado de máquina. Eficiência de sample refere-se à capacidade de um modelo de aprender com uma pequena quantidade de dados, em vez de requerer grandes quantidades de dados para alcançar um bom desempenho.
A eficiência de sample é crítica em muitas aplicações do mundo real, onde os dados podem ser escassos ou caros para coletar. Ao desenvolver modelos que são altamente eficientes em termos de sample, os pesquisadores podem criar sistemas de aprendizado de máquina mais eficazes e eficientes que possam aprender com dados limitados.
O desempenho do pequeno modelo transformer no benchmark ARC-1 demonstra que é possível alcançar resultados de ponta com uma pequena quantidade de dados. Isso tem implicações importantes para o desenvolvimento de sistemas de aprendizado de máquina mais eficientes e eficazes.
Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.