Um avanço significativo no campo dos Modelos de Linguagem Grande (MLLs) foi alcançado com a introdução de Cache-to-Cache (C2C), um novo paradigma para comunicação semântica direta entre MLLs. Desenvolvido por uma equipe de pesquisadores, incluindo Tianyu Fu, Zihan Min, Hanling Zhang, Jichao Yan, Guohao Dai, Wanli Ouyang e Yu Wang, essa abordagem visa superar as limitações da comunicação tradicional baseada em texto entre MLLs.

Nos sistemas de MLLs convencionais, os modelos se comunicam por meio de texto, o que resulta na perda de informações semânticas ricas e incursa latência de geração token-a-token. O método C2C, por outro lado, utiliza uma rede neural para projetar e fundir o cache KV-fonte com o do modelo-alvo, permitindo transferência semântica direta. Esse processo é facilitado por um mecanismo de controle aprendível que seleciona as camadas-alvo que se beneficiam da comunicação de cache.

Experimentos realizados pelos pesquisadores mostraram que o C2C alcança 6,4-14,2% de precisão média mais alta do que os modelos individuais. Além disso, supera o paradigma de comunicação por texto em aproximadamente 3,1-5,4%, enquanto entrega uma aceleração média de 2,5x na latência. Esses resultados sugerem que o C2C tem o potencial de revolucionar a forma como os MLLs interagem, levando a sistemas de MLLs mais eficientes e eficazes.

As implicações dessa inovação são significativas, pois podem levar a melhorias no desempenho em uma ampla gama de aplicações, desde processamento de linguagem natural até aprendizado de máquina. Com a disponibilidade do código da equipe de pesquisa, outros desenvolvedores e pesquisadores podem explorar e construir sobre essa inovação, impulsionando avanços adicionais no campo.

Cet article a été rédigé avec l'assistance de l'IA.
News Factory APP - actualités agentiques pour booster votre SEO et AEO.