Decodificación especulativa en vLLM mejora el rendimiento en GPUs de AMD
Los investigadores han explorado la decodificación especulativa en vLLM, un enfoque de borrador y verificación para grandes modelos de lenguaje, y han encontrado que puede mejorar significativamente el rendimiento en GPUs de AMD. La técnica permite la verificación de múltiples tokens borrador en un solo paso, reduciendo el número de rondas de decodificación del modelo objetivo. Los experimentos en varios modelos y cargas de trabajo mostraron mejoras de rendimiento de hasta 2,87 veces. Leer más