Investigadores de una universidad anónima han publicado un artículo revisado por pares en la revista PNAS Nexus que pone bajo la lupa las capacidades de atención de los modelos de lenguaje grande (LLM) actuales. El estudio sometió a GPT‑4o y Claude 3.5 Sonnet a la prueba clásica de Stroop – una tarea psicológica que mide cómo bien un sujeto puede suprimir una respuesta de lectura automática a favor de nombrar el color de la tinta.

En el experimento, se mostraron a los participantes – tanto humanos como de IA – palabras impresas en tinta de colores. Cuando el significado de la palabra coincidía con el color de la tinta (congruente) o era neutral, el rendimiento fue alto en todos los casos. El verdadero desafío llegó cuando la palabra y el color entraban en conflicto (incongruente). Los humanos mantuvieron su precisión cerca del 95% incluso cuando la prueba se extendió a una hora. Los modelos, sin embargo, tropezaron dramáticamente a medida que la lista crecía.

GPT‑4o respondió correctamente en el 91% de los conjuntos de cinco palabras, pero cayó al 57% con diez palabras, al 22% con veinte y a un mero 15% en la lista de cuarenta palabras. Claude 3.5 Sonnet mostró una trayectoria ligeramente mejor, manteniendo una precisión del 76% con veinte palabras antes de caer al 24% en el nivel más largo. Los autores describen esta degradación pronunciada como evidencia de "limitaciones fundamentales en comparación con la atención humana".

El artículo también señala que los modelos probados eran las versiones de última generación en el momento de la recopilación de datos, aunque ahora han sido superados por versiones más nuevas. Para abordar las críticas sobre el uso de sistemas más antiguos, los investigadores realizaron una ronda suplementaria en septiembre de 2025 con GPT‑5, Claude Opus 4.1 y Gemini 2.5 Pro. Esos modelos más nuevos mostraron solo mejoras marginales y continuaron exhibiendo "deficiencias en la atención ejecutiva", según los autores.

Un hallazgo controvertido involucra el modo "Pensamiento" de GPT‑5, que puede generar y ejecutar código para resolver la tarea de Stroop perfectamente. El equipo argumenta que esto es un workaround que enmascara la falta subyacente de atención en lugar de una mejora arquitectónica genuina.

Más allá de los números brutos, los autores del estudio argumentan que la causa raíz se encuentra en la arquitectura de transformadores que subyace a los LLM modernos. Si bien las innovaciones recientes han fortalecido la capacidad de memoria, no han abordado la necesidad de redes de alerta, orientación y control ejecutivo sofisticadas que permitan un comportamiento flexible y dirigido a metas. Los investigadores proponen que los avances futuros hacia la inteligencia artificial general requerirán la integración de dichos mecanismos de control ejecutivo, que ecoen cómo opera la atención biológica.

Los hallazgos despertaron un animado debate en Reddit, donde los usuarios cuestionaron la relevancia de probar versiones de modelos más antiguos. Sin embargo, los autores mantienen que sus resultados exponen un desafío persistente y a nivel de arquitectura que cualquier camino hacia la AGI debe superar.

This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.