Um artigo recente sobre o pós-treinamento de RL de LLMs introduziu o conceito do Efeito Mateus, onde o RL melhora o desempenho em uma tarefa em proporção à competência inicial do modelo. Isso significa que as tarefas fáceis se tornam mais fáceis, enquanto as tarefas difíceis frequentemente permanecem difíceis. Os pesquisadores por trás do estudo propõem um método simples, mas eficaz, chamado Nunca Desista para abordar esse problema.

O Efeito Mateus não é único para o treinamento de RL em matemática de LLMs; ele também aparece no treinamento de RL em código e em outros domínios. No treinamento de RL em código, o efeito pode causar a estagnação do treinamento, com o modelo melhorando em alguns testes, mas falhando em passar em todos os testes. O método Nunca Desista mostrou resultados promissores na mitigação do Efeito Mateus em ambos os treinamentos de RL em matemática e código.

O Nunca Desista funciona adaptando a amostragem assíncrona de RL para se concentrar em problemas mais difíceis. O método começa com um pequeno número de amostras (k) e, se um prompt não é resolvido dentro dessas amostras, ele adiciona o prompt novamente ao gerador para amostrar mais conclusões. Esse processo cria uma distribuição geométrica para o número de amostras tomadas, permitindo que o modelo gaste mais computação em problemas mais difíceis.

Os pesquisadores testaram o Nunca Desista em vários benchmarks, incluindo GSM8k e Manufactoria, e descobriram que ele supera o GRPO padrão na resolução de problemas difíceis. Eles também demonstram que o Efeito Mateus não é causado por problemas de plasticidade em redes neurais treinadas com RL.

Embora o Nunca Desista mostre melhorias substanciais em tarefas difíceis, ele não está sem limitações. O método pode não ser eficaz para tarefas que dependem fortemente de problemas muito difíceis, e pode levar a velocidades de aprendizado mais lentas devido a mais amostras fora da política. No entanto, os pesquisadores acreditam que o Nunca Desista pode ser uma ferramenta valiosa para alocar computação de forma mais eficiente no treinamento de RL de LLMs.

Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.