Um estudo publicado na PNAS Nexus testou GPT-4o e Claude 3.5 Sonnet no teste de Stroop, um clássico teste psicológico que mede a capacidade de suprimir respostas automáticas. Os resultados mostram que os modelos de IA performam mal no teste, especialmente à medida que o comprimento da tarefa aumenta.
Os pesquisadores também realizaram testes suplementares com GPT-5, Claude Opus 4.1 e Gemini 2.5 Pro, mas os resultados mostraram apenas ganhos marginais. Os autores argumentam que a causa raiz está na arquitetura de transformador que subjaz os atuais LLMs e que a integração de mecanismos de controle executivo é essencial para alcançar a inteligência artificial geral.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.