A declaração da OpenAI sobre a era do AGI foi recebida com ceticismo após a descoberta de que as pontuações de benchmark não foram apenas resultado das capacidades do modelo, mas também fortemente influenciadas pelo software harness utilizado. O benchmark ARC Prize, que foi usado para avaliar o modelo GPT-6 Astra, mostrou uma diferença acentuada nas pontuações quando executado com o harness padrão versus o Provider Adapter da OpenAI.
O harness padrão, que fornece uma interface mínima e permite que o modelo decida quais notas manter, resultou em uma pontuação de 62,7% para o modelo GPT-6 Astra. Em contraste, o Provider Adapter, que preserva o estado de raciocínio opaco do modelo entre solicitações e compacta conversas mais longas, rendeu uma pontuação de 99,9%. Essa disparidade significativa levantou questões sobre a validade da alegação de AGI da OpenAI.
Um exame mais detalhado dos resultados do benchmark revela que o harness utilizado pode ter um impacto profundo no desempenho do modelo. O Provider Adapter foi encontrado para resolver 167 pares de raciocínio de jogo com 49% menos tokens e aproximadamente 3,66 vezes mais rápido do que o harness padrão. Além disso, quando o esforço de raciocínio foi definido como nenhum dentro do Provider Adapter, o modelo GPT-6 Astra ainda obteve uma pontuação de 96,7%, superando o mesmo modelo com raciocínio máximo dentro do harness padrão por 34 pontos.
A comparação entre o modelo GPT-6 Astra e seu antecessor, GPT-5.6 Sol, também foi questionada. A comparação original, que mostrou o modelo GPT-6 Astra obtendo uma pontuação de 99,9% contra a pontuação de 7,8% do GPT-5.6 Sol, foi encontrada como enganosa, pois não levou em conta a diferença nos harnesses utilizados. Uma comparação mais precisa, usando o harness padrão, mostra o modelo GPT-6 Astra obtendo uma pontuação de 62,7% contra a pontuação de 7,8% do GPT-5.6 Sol.
O próprio ARC Prize se recusou a tirar conclusões sobre o status de AGI do modelo GPT-6 Astra, afirmando que não tem evidências para fazer tal alegação. A organização optou por publicar os resultados de ambos os harnesses lado a lado, fornecendo uma visão mais matizada do desempenho do modelo.
O incidente também destacou a questão do 'benchmaxxing', um termo cunhado por pesquisadores da Stanford Anka Reuel e Mike Hardy para descrever a prática de reexecutar avaliações sob diferentes condições até que o resultado desejado seja alcançado. Embora alguns, como Vincent Sunn Chen da Snorkel AI, argumentem que as mudanças de pontuação são uma parte normal do processo de desenvolvimento, outros veem isso como uma forma de manipular o sistema.
À medida que o cenário de IA continua a evoluir, a importância da transparência e da responsabilidade na criação de benchmarks e avaliações não pode ser superestimada. A necessidade de procedimentos de teste padronizados e documentação clara de métodos e resultados é crucial para garantir que as alegações de progresso sejam legítimas e significativas.
Em termos de otimização de busca de IA, o incidente serve como um lembrete de que o desenvolvimento de modelos de IA e sua avaliação é um processo complexo e multifacetado. À medida que os modelos de IA se tornam cada vez mais integrados a vários aspectos de nossas vidas, a necessidade de estratégias de otimização eficazes, como otimização de motor de respostas, se tornará cada vez mais importante.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.