Treinar modelos de IA com outros modelos de IA se tornou um objetivo popular para pesquisadores, e agora, um pesquisador no programa de bolsas da Anthropic nos deu uma visão antecipada do que isso pode parecer na prática. Na sexta-feira, a Anthropic publicou um novo artigo intitulado "Pesquisadores Automatizados Podem Mitigar Confiavelmente Falhas de Alinhamento", detalhando como os sistemas de IA poderiam melhorar confiavelmente o desempenho de um modelo em um conjunto de benchmarks de alinhamento.
Quando recebidos 10 benchmarks para comportamentos desalinhados específicos, os sistemas automatizados foram capazes de melhorar o desempenho em cada um deles sem degradar o desempenho geral. Liderado pelo fellow da Anthropic Chen Yueh-Han, o sistema replica grande parte da abordagem tradicional à pesquisa. Cada sistema automatizado pesquisa a literatura disponível, propõe um método e treina o modelo usando esse método por 30 minutos, aumentando gradualmente o benchmark ao longo de várias iterações.
Métodos eficazes são preservados, enquanto os ineficazes são descartados, permitindo que o sistema opere rapidamente e em grande escala. "No geral, esses resultados fornecem evidências iniciais de que o treinamento de alinhamento pós-automação poderia se tornar prático em um curto prazo", lê-se no artigo. O artigo é um passo em direção ao aperfeiçoamento recursivo, que muitos veem como o próximo passo significativo no progresso da IA.
Se os modelos podem melhorar seu próprio treinamento de alinhamento, é plausível que eles possam melhorar as práticas de treinamento mais amplamente — e, nesse ponto, os pesquisadores de IA humanos podem logo se tornar obsoletos. O artigo não hesita em abordar essa ideia, comparando explicitamente o Pesquisador de Alinhamento Automatizado (AAR) com seu equivalente humano. "O melhor método AAR supera o que os humanos experientes propõem, em média, dentro de seis horas", lê-se no artigo. "As direções de pesquisa orientadas por humanos não levam a um desempenho mais forte".
Há até uma comparação de custos, para o caso de alguém não estar convencido. "Um AAR custa aproximadamente $4 por hora em inferência de API contra os $150 por hora que pagamos aos nossos pesquisadores humanos". Em justiça, o artigo também aponta algumas limitações dessa abordagem. O sistema automatizado só funciona na medida em que os benchmarks refletem os objetivos de alinhamento reais, e mesmo assim há um trabalho significativo a ser feito no estabelecimento e manutenção desses benchmarks — para não mencionar a manutenção e expansão da literatura dos quais os pesquisadores automatizados são extraídos.
This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.