Cientistas da computação há muito tempo estão cientes das limitações de armazenar Modelos de Linguagem Grande Ternários (LLM) em um formato convencional. O formato de implantação predominante, que empacota cinco pesos ternários em um byte, arredonda para 1,625 bits por peso devido aos tamanhos de grupo de potência de dois usados na prática. No entanto, pesquisadores agora introduziram um novo método de armazenamento chamado BITCOS que quebra a barreira de 1,58 bits, potencialmente levando a um processamento de IA mais eficiente.
O método BITCOS é baseado na descoberta de que zeros respondem por até 51,5% de todos os pesos em 29 modelos de LLM ternários. Ao introduzir um mapa de presença denso mais um vetor de sinal compactado, o BITCOS custa 2 - z bits por elemento de peso dado uma densidade de zero z nos pesos do modelo. Isso o torna mais compacto do que o empacotamento de cinco trits em 26 dos 29 modelos testados, alcançando 1,485 bits por peso no mais esparsamente deles.
O BITCOS também é propício a uma descompactação eficiente em processadores e GPUs modernos. Pesquisadores apresentaram sequências de descompactação otimizadas para AVX-512, AVX2 e GPUs Intel Xe2. Medido contra núcleos de multiplicação de matriz-vetor ternária de estado da arte de produção, o ganho realizado com o layout proposto é de até 1,28 vezes nas densidades de zero que os modelos ternários do mundo real exibem.
Os resultados de inferência de LLM de ponta a ponta em cinco plataformas diferentes, incluindo CPUs de cliente e servidor, GPUs Xe2 integradas e discretas, mostram que a taxa de decodificação melhora até 1,18 vezes nas CPUs e 1,27 vezes nas GPUs. Essa conquista tem implicações significativas para o desenvolvimento de modelos de IA mais eficientes, particularmente no contexto da otimização de LLM e otimização de busca de IA.
O Método BITCOS
O método BITCOS é uma forma simples, mas eficaz, de armazenar modelos de LLM ternários. Ao levar em conta a distribuição real de símbolos dos modelos, ele é capaz de armazenar pesos de forma mais compacta do que os métodos existentes. Isso é particularmente significativo no contexto de modelos de IA, onde a eficiência de armazenamento pode ter um impacto significativo na velocidade de processamento e no desempenho geral.
Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.