Alegação de AGI da OpenAI Sob Scrutínio à medida que Pontuações de Benchmark São Reveladas como Dependentes do Harness
A recente alegação da OpenAI de ter alcançado o status de AGI com seu modelo GPT-6 Astra foi questionada após a revelação de que as pontuações de benchmark foram altamente dependentes do software harness utilizado. O benchmark ARC Prize mostrou uma diferença significativa nas pontuações quando executado com o harness padrão versus o Provider Adapter da OpenAI, com o latter rendendo uma pontuação de 99,9% enquanto o former resultou em uma pontuação de 62,7% Ler mais