Una actualización reciente de la investigación sobre preentrenamiento eficiente en cómputo y escalado a modelos de trillion-parámetros revela un avance significativo. La nueva receta de preentrenamiento es ahora más de 10 veces más eficiente en cómputo que los modelos base de peso abierto líderes. Esta ganancia de eficiencia permite igualar a DeepSeek V4 Pro Base utilizando aproximadamente 50 veces menos FLOPs, lo que se traduce en aproximadamente la mitad del cómputo de preentrenamiento de GPT3 o alrededor de $0,5 millones en GB200.
Los investigadores encontraron que al compounding la eficiencia algorítmica con el tiempo, pudieron lograr esta mejora sustancial. Continuaron escalando, gastando alrededor de $4 millones, y superaron significativamente a todos los modelos base abiertos públicamente disponibles en evaluaciones de perplexidad. Estos resultados sugieren que entrenar un modelo de esta capacidad costaría más de $100 millones bajo la receta de DeepSeek V4 Pro, destacando la importancia del avance.
El equipo cree que el preentrenamiento, el RL agente y el contexto largo son suficientes para construir agentes de codificación superhumanos y automatizar la investigación y desarrollo de IA. Comenzaron centrándose en el contexto largo y han hecho un progreso sustancial en el preentrenamiento. La evaluación del rendimiento del modelo se realizó en datos retenidos, incluyendo evaluaciones de código, razonamiento en problemas matemáticos y evaluaciones de texto en artículos de investigación recientes. Los resultados muestran mejoras significativas en varios dominios.
Para medir la generalización, los investigadores evaluaron la pérdida en datos retenidos y encontraron que su modelo supera a los modelos líderes abiertos. También probaron el conocimiento del modelo en dominios clave para identificar lagunas en el conjunto de datos. Al recopilar cubos granulares de contenido, pueden obtener señales más precisas sobre el rendimiento del modelo.
El objetivo del equipo es construir el mejor modelo para la codificación y la investigación y desarrollo autónoma de IA. Para lograr esto, evalúan los dominios que depriorizan, como hechos sobre personas notables, noticias locales o deportes/eventos. Los resultados de la evaluación muestran que su receta es más eficiente en cómputo que los mejores modelos abiertos por evaluación.
Los investigadores encontraron que no hay atajos para lograr mejoras significativas en la eficiencia del preentrenamiento. Tuvo que construir una base estable primero, que incluyó una convergencia suave, una calidad de entrenamiento de baja precisión, una infraestructura rápida y estable, y reglas de escalado de hiperparámetros correctas. También tuvieron que cazar errores y evaluar cada modelo, optimizador o cambio de datos entrenando tres modelos que abarcan dos órdenes de magnitud de cómputo.
Mirando hacia adelante, el equipo planea escalar el RL de horizonte largo, entrenando a agentes para que sigan aprendiendo después de la implementación a través del contexto largo. También están trabajando en técnicas de entrenamiento de alineación que presentan propiedades teóricas robustas. Con su trabajo de preentrenamiento y contexto largo ahora bastante maduro, están en condiciones de hacer avances significativos adicionales en el campo.
Cet article a été rédigé avec l'assistance de l'IA.
News Factory APP - actualités agentiques pour booster votre SEO et AEO.