Uma atualização recente de pesquisa sobre pré-treinamento eficiente em computação e escalonamento para modelos de trilhões de parâmetros revela um avanço significativo. A nova receita de pré-treinamento agora é mais de 10 vezes mais eficiente em computação do que os modelos de base de peso aberto líderes. Esse ganho de eficiência permite a correspondência do DeepSeek V4 Pro Base usando aproximadamente 50 vezes menos FLOPs, o que se traduz em cerca de metade da computação de pré-treinamento do GPT3 ou cerca de $0,5 milhão no GB200.

Os pesquisadores descobriram que, ao compor a eficiência algorítmica ao longo do tempo, eles foram capazes de alcançar essa melhoria substancial. Eles continuaram escalonando, gastando cerca de $4 milhões, e superaram significativamente todos os modelos de base abertos publicamente disponíveis nas avaliações de perplexidade. Esses resultados sugerem que treinar um modelo com essa capacidade custaria mais de $100 milhões sob a receita do DeepSeek V4 Pro, destacando a importância do avanço.

A equipe acredita que o pré-treinamento, o RL agente e o contexto longo são suficientes para construir agentes de codificação superhumanos e automatizar a P&D de IA. Eles começaram focando no contexto longo e fizeram progressos substanciais no pré-treinamento. A avaliação do desempenho do modelo foi realizada em dados mantidos, incluindo avaliações de código, raciocínio em problemas matemáticos e avaliações de texto em artigos de pesquisa recentes. Os resultados mostram melhorias significativas em vários domínios.

Para medir a generalização, os pesquisadores avaliaram a perda nos dados mantidos e descobriram que seu modelo supera os modelos abertos líderes. Eles também testaram o conhecimento do modelo em domínios-chave para identificar lacunas no conjunto de dados. Ao coletar baldes granulares de conteúdo, eles podem obter sinais mais precisos sobre o desempenho do modelo.

O objetivo da equipe é construir o melhor modelo para codificação e P&D de IA autônoma. Para alcançar isso, eles avaliam os domínios que despriorizam, como fatos sobre pessoas notáveis, notícias locais ou esportes/eventos. Os resultados da avaliação mostram que sua receita é mais eficiente em computação do que os melhores modelos abertos por avaliação.

Os pesquisadores descobriram que não há atalhos para alcançar melhorias significativas na eficiência do pré-treinamento. Eles tiveram que construir uma base estável primeiro, que incluiu convergência suave, qualidade de treinamento de baixa precisão, infraestrutura rápida e estável e regras de escalonamento de hiperparâmetros corretas. Eles também tiveram que caçar bugs e avaliar cada modelo, otimizador ou mudança de dados, treinando três modelos que abrangem duas ordens de magnitude de computação.

Olhando para o futuro, a equipe planeja escalonar o RL de longo horizonte, treinando agentes para continuar aprendendo após a implantação por meio do contexto longo. Eles também estão trabalhando em técnicas de treinamento de alinhamento que apresentam propriedades teóricas robustas. Com seu trabalho de pré-treinamento e contexto longo agora muito maduro, eles estão preparados para fazer avanços significativos adicionais no campo.

Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.