Los científicos informáticos han sido conscientes durante mucho tiempo de las limitaciones de almacenar Modelos de Lenguaje Grande Ternarios (LLM) en un formato convencional. El formato de implementación prevaleciente, que empaqueta cinco pesos ternarios en un byte, se redondea a 1,625 bits por peso debido a los tamaños de grupo de potencia de dos utilizados en la práctica. Sin embargo, los investigadores han presentado un nuevo método de almacenamiento llamado BITCOS que rompe la barrera de 1,58 bits, lo que podría llevar a un procesamiento de inteligencia artificial más eficiente.
El método BITCOS se basa en el hallazgo de que los ceros representan hasta el 51,5% de todos los pesos en 29 modelos de LLM ternarios. Al introducir un mapa de presencia denso y un vector de signos compactado, BITCOS cuesta 2 - z bits por elemento de peso dado una densidad de ceros z en los pesos del modelo. Esto lo hace más compacto que el empaquetado de cinco trits en 26 de los 29 modelos probados, alcanzando 1,485 bits por peso en el más escaso de ellos.
BITCOS también es susceptible de desempaquetado eficiente en procesadores y GPUs modernos. Los investigadores han presentado secuencias de desempaquetado optimizadas para AVX-512, AVX2 y GPUs Intel Xe2. Medido contra kernels de multiplicación de matrices vectoriales ternarias de estado de la técnica, la ganancia realizada con el diseño propuesto es de hasta 1,28 veces en las densidades de ceros que exhiben los modelos ternarios del mundo real.
Los resultados de inferencia de LLM de extremo a extremo en cinco plataformas diferentes, incluyendo CPUs de cliente y servidor, GPUs Xe2 integradas y discretas, muestran que el rendimiento de decodificación mejora hasta 1,18 veces en las CPUs y 1,27 veces en las GPUs. Este avance tiene implicaciones significativas para el desarrollo de modelos de inteligencia artificial más eficientes, particularmente en el contexto de la optimización de LLM y la optimización de búsqueda de inteligencia artificial.
El método BITCOS
El método BITCOS es una forma simple pero efectiva de almacenar modelos de LLM ternarios. Al tener en cuenta la distribución real de símbolos de los modelos, es capaz de almacenar pesos de manera más compacta que los métodos existentes. Esto es particularmente significativo en el contexto de los modelos de inteligencia artificial, donde la eficiencia de almacenamiento puede tener un impacto importante en la velocidad de procesamiento y el rendimiento general.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.