Un investigador ha logrado un avance significativo en el entrenamiento de modelos de lenguaje grandes, alcanzando una puntuación CORE de 0.384 con un modelo de 3.8 mil millones de parámetros por solo \$998. Este logro es un testimonio del rápido progreso que se está haciendo en el campo de la inteligencia artificial y la creciente accesibilidad de la informática de alto rendimiento.
El modelo, entrenado en 65 mil millones de tokens durante 43 horas, supera al modelo GPT-2, que fue un resultado de vanguardia en 2019. El logro del investigador es aún más impresionante considerando que se logró con una sola persona y un presupuesto limitado, mientras que el modelo GPT-2 fue desarrollado por un laboratorio bien financiado con un equipo grande.
El proceso de entrenamiento involucró alquilar GPUs por hora y utilizar un marco de configuración para entrenar decodificadores pequeños de LLM. El investigador experimentó con varias técnicas, incluyendo horarios de aprendizaje trapezoidales, optimizadores Muon y entrenamiento FP8, para optimizar el rendimiento del modelo. Los resultados muestran que el modelo es capaz de lograr resultados de alta calidad con un presupuesto relativamente modesto.
Uno de los hallazgos clave de la investigación es la importancia de la longitud del contexto para lograr puntuaciones CORE altas. El investigador encontró que aumentar la longitud del contexto de 1024 a 2048 tokens resultó en una mejora significativa en el rendimiento, particularmente en tareas que son muy sensibles al contexto. Sin embargo, esta mejora se logró a costa de una reducción de la producción, lo que destaca la necesidad de una optimización cuidadosa de los parámetros del modelo y los procedimientos de entrenamiento.
El estudio también destaca el potencial de las incrustaciones de valor para mejorar el rendimiento del modelo. El investigador encontró que las incrustaciones de valor fueron útiles para un modelo pequeño y vinieron con casi ningún costo de producción, lo que sugiere que podrían ser una herramienta valiosa para optimizar el rendimiento del modelo en el futuro.
En general, el logro del investigador demuestra el rápido progreso que se está haciendo en el campo de la inteligencia artificial y la creciente accesibilidad de la informática de alto rendimiento. A medida que el campo continúa evolucionando, será emocionante ver qué otros avances se pueden lograr con presupuestos y recursos limitados.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.