Anthropic Presenta un Sistema Automatizado que Supera a los Investigadores Humanos en Pruebas de Alineación de IA
Anthropic publicó un artículo que detalla un Investigador de Alineación Automatizado (AAR) que mejora el rendimiento en diez pruebas de alineación de IA sin sacrificar la capacidad general. Liderado por el compañero Chen Yueh-Han, el sistema imita los pasos de investigación tradicionales: búsqueda de literatura, propuesta de métodos, entrenamiento de corta duración y refina los enfoques de manera iterativa. En las pruebas, el AAR superó a los investigadores humanos experimentados en menos de seis horas y a una fracción del costo, lo que genera conversaciones sobre la mejora recursiva a corto plazo, aunque se señala que el enfoque depende de la calidad de las pruebas y la literatura curada. Leer más