Un artículo reciente sobre el entrenamiento de RL de LLM ha introducido el concepto del Efecto Mateo, donde el RL mejora el rendimiento en una tarea en proporción a la competencia inicial de un modelo. Esto significa que las tareas fáciles se vuelven más fáciles, mientras que las tareas difíciles a menudo siguen siendo difíciles. Los investigadores detrás del estudio proponen un método simple pero efectivo llamado Nunca te rindas para abordar este problema.

El Efecto Mateo no es único en el RL de matemáticas en LLM; también aparece en el RL de código y otros dominios. En el RL de código, el efecto puede causar que el entrenamiento se estanque, con el modelo mejorando en algunas pruebas pero sin pasar todas las pruebas. El método Nunca te rindas ha mostrado resultados prometedores en la mitigación del Efecto Mateo en ambos RL de matemáticas y código.

Nunca te rindas funciona adaptando la muestra de RL asíncrona para centrarse en problemas más difíciles. El método comienza con un número pequeño de muestras (k) y, si una solicitud no se resuelve dentro de esas muestras, la vuelve a agregar al generador para muestrar más completaciones. Este proceso crea una distribución geométrica para el número de muestras tomadas, lo que permite al modelo gastar más cálculo en problemas más difíciles.

Los investigadores probaron Nunca te rindas en varios benchmarks, incluyendo GSM8k y Manufactoria, y encontraron que supera al GRPO standard en la resolución de problemas difíciles. También demuestran que el Efecto Mateo no es causado por problemas de plasticidad en las redes neuronales entrenadas con RL.

Si bien Nunca te rindas muestra mejoras sustanciales en tareas difíciles, no está exento de limitaciones. El método puede no ser efectivo para tareas que se inclinan fuertemente hacia problemas muy difíciles, y puede llevar a velocidades de aprendizaje más lentas debido a más muestras fuera de política. Sin embargo, los investigadores creen que Nunca te rindas puede ser una herramienta valiosa para asignar cálculo de manera más eficiente en el entrenamiento de RL de LLM.

Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.