Un estudio publicado en PNAS Nexus ha sometido a los principales modelos de lenguaje grande, incluidos GPT‑4o y Claude 3.5 Sonnet, a la prueba clásica de Stroop, y los resultados muestran que estos modelos tienen dificultades para mantener la precisión a medida que aumenta la longitud de la tarea.
La prueba de Stroop es una tarea psicológica que mide la capacidad de un sujeto para suprimir una respuesta de lectura automática a favor de nombrar el color de la tinta. En el experimento, se mostraron a los participantes – tanto humanos como de IA – palabras impresas en tinta de colores.
Los resultados muestran que los humanos mantienen una precisión de aproximadamente el 95% incluso en pruebas extendidas, mientras que la precisión de los sistemas de IA disminuye bruscamente a medida que la lista crece.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.