Entrenar modelos de IA con otros modelos de IA se ha convertido en un objetivo popular para los investigadores, y ahora, un investigador en el programa de becarios de Anthropic nos ha dado una vista previa de lo que podría parecerse en la práctica. El viernes, Anthropic publicó un nuevo artículo titulado "Los investigadores automatizados pueden mitigar de manera confiable los fallos de alineación", que detalla cómo los sistemas de IA podrían mejorar de manera confiable el rendimiento de un modelo en un conjunto de pruebas de alineación.
Cuando se les dio 10 pruebas para comportamientos desalineados específicos, los sistemas automatizados pudieron mejorar el rendimiento en cada una de ellas sin degradar el rendimiento general. Dirigido por el becario de Anthropic Chen Yueh-Han, el sistema replica gran parte del enfoque tradicional de la investigación. Cada sistema automatizado busca la literatura disponible, propone un método y entrena el modelo utilizando ese método durante 30 minutos, aumentando gradualmente la prueba durante varias iteraciones.
Los métodos efectivos se conservan, mientras que los inefectivos se descartan, lo que permite que el sistema opere de manera rápida y a gran escala. "En general, estos resultados proporcionan una primera evidencia de que la post-formación de alineación automatizada podría volverse práctica en el corto plazo", se lee en el artículo. El artículo es un paso hacia la auto-mejora recursiva, que muchos consideran el próximo paso significativo en el progreso de la IA.
Si los modelos pueden mejorar su propia formación de alineación, es plausible que puedan mejorar las prácticas de formación en general — en c!ase de lo cual, los investigadores de IA humanos podrían pronto volverse obsoletos. El artículo no se anda con rodeos al abordar esta idea, comparando explícitamente al Investigador de Alineación Automatizado (AAR) con su equivalente humano. "El mejor método AAR supera lo que proponen los humanos experimentados, en promedio dentro de seis horas", se lee en el artículo. "Las direcciones de investigación guiadas por humanos no conducen a un rendimiento más fuerte".
Hay incluso una comparación de costos, en caso de que alguien no estuviera convencido. "Un AAR cuesta aproximadamente $4 por hora en inferencia de API contra los $150 por hora que pagamos a nuestros investigadores humanos". En justicia, el artículo también señala algunas limitaciones de este enfoque. El sistema automatizado solo funciona en la medida en que las pruebas reflejen los objetivos de alineación reales, y incluso entonces hay un trabajo significativo por hacer en establecer y mantener esas pruebas — por no mencionar mantener y expandir la literatura de la que se nutren los investigadores automatizados.
Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.