Decodificação Especulativa em vLLM Melhora o Desempenho em GPUs AMD
Pesquisadores exploraram a decodificação especulativa em vLLM, uma abordagem de rascunho e verificação para grandes modelos de linguagem, e descobriram que pode melhorar significativamente o desempenho em GPUs AMD. A técnica permite a verificação de múltiplos tokens rascunhados em uma única passagem, reduzindo o número de rodadas de decodificação do modelo de destino. Experimentos em vários modelos e cargas de trabalho mostraram melhorias de throughput de até 2,87x. Ler mais