La declaración de OpenAI sobre la era de AGI fue recibida con escepticismo después de que se descubrió que las puntuaciones de referencia no fueron solo el resultado de las capacidades del modelo, sino también influenciadas en gran medida por el software de arnés utilizado. La referencia de premio ARC, que se utilizó para evaluar el modelo GPT-6 Astra, mostró una diferencia marcada en las puntuaciones cuando se ejecutó con el arnés estándar versus el adaptador de proveedor de OpenAI.

El arnés estándar, que proporciona una interfaz mínima y permite que el modelo decida qué notas llevar adelante, resultó en una puntuación del 62,7% para el modelo GPT-6 Astra. En contraste, el adaptador de proveedor, que preserva el estado de razonamiento opaco del modelo entre solicitudes y compacta conversaciones más largas, obtuvo una puntuación del 99,9%. Esta disparidad significativa ha planteado preguntas sobre la validez de la afirmación de AGI de OpenAI.

Un examen más cercano de los resultados de la referencia revela que el arnés utilizado puede tener un impacto profundo en el rendimiento del modelo. El adaptador de proveedor se encontró que resolvió 167 pares de razonamiento de juego con un 49% menos de tokens y aproximadamente 3,66 veces más rápido que el arnés estándar. Además, cuando el esfuerzo de razonamiento se estableció en ninguno dentro del adaptador de proveedor, el modelo GPT-6 Astra aún obtuvo una puntuación del 96,7%, superando al mismo modelo con un esfuerzo de razonamiento máximo dentro del arnés estándar por 34 puntos.

La comparación entre el modelo GPT-6 Astra y su predecesor, GPT-5.6 Sol, también ha sido cuestionada. La comparación original, que mostró el modelo GPT-6 Astra obteniendo una puntuación del 99,9% contra la puntuación del 7,8% del GPT-5.6 Sol, se encontró que era engañosa ya que no tuvo en cuenta la diferencia en los arneses utilizados. Una comparación más precisa, utilizando el arnés estándar, muestra el modelo GPT-6 Astra obteniendo una puntuación del 62,7% contra la puntuación del 7,8% del GPT-5.6 Sol.

El premio ARC en sí ha declinado a sacar conclusiones sobre el estado de AGI del modelo GPT-6 Astra, afirmando que carece de evidencia para hacer tal afirmación. La organización ha optado por publicar ambos resultados de arnés uno al lado del otro, proporcionando una visión más matizada del rendimiento del modelo.

El incidente también ha resaltado el problema del 'benchmaxxing', un término acuñado por los investigadores de Stanford Anka Reuel y Mike Hardy para describir la práctica de volver a ejecutar evaluaciones bajo diferentes condiciones hasta que se obtiene el resultado deseado. Mientras que algunos, como Vincent Sunn Chen de Snorkel AI, argumentan que los cambios en las puntuaciones son una parte normal del proceso de desarrollo, otros lo ven como una forma de manipular el sistema.

A medida que el panorama de la IA continúa evolucionando, la importancia de la transparencia y la rendición de cuentas en la evaluación y la referencia no puede ser sobreestimada. La necesidad de procedimientos de prueba estandarizados y una documentación clara de los métodos y resultados es crucial para garantizar que las afirmaciones de progreso sean legítimas y significativas.

En términos de optimización de búsqueda de IA, el incidente sirve como recordatorio de que el desarrollo de modelos de IA y su evaluación es un proceso complejo y multifacético. A medida que los modelos de IA se integran cada vez más en diversos aspectos de nuestras vidas, la necesidad de estrategias de optimización efectivas, como la optimización del motor de respuestas, se volverá cada vez más importante.

Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.