DeepSeek-V4.1 Flash é um modelo de mistura de especialistas multimodais que tem feito ondas na comunidade de IA com seu desempenho impressionante. A arquitetura do modelo é projetada para compressão agressiva de KVCache, com uma escala de parâmetros de 552B e suporte nativo para entrada multimodal. Isso permite que ele suporte contextos de até 1 milhão de tokens, tornando-se uma melhoria significativa em relação aos modelos anteriores.
O desempenho do modelo é devido em parte à sua arquitetura Codificador-Decodificador Causal (CED), que reduz a computação de preenchimento por quase metade enquanto mantém o desempenho comparável à linha de base. A arquitetura CED é inspirada no conceito YoCo, que reduz a computação de preenchimento permitindo que as camadas superiores compartilhem diretamente o Cache KV produzido pelas camadas inferiores.
Outro componente-chave do modelo é seu mecanismo CSA2 (Atenção Esparsa entre Camadas), que utiliza conjuntamente três dimensões para reduzir o armazenamento de cache KV e a computação de atenção. O mecanismo CSA2 compartilha o principal KV e Indexer K entre as camadas, permitindo que as camadas reutilizem os índices Top-K enquanto desacopla o compartilhamento de cache e a reutilização de índices.
O modelo também apresenta uma abordagem de processamento de Indexador Esparsso Hierárquico (HSI), que constrói uma seleção de nível de bloco como o Pool de Candidatos para o modo Reindex CSA2 subsequente. Essa abordagem reduz a sobrecarga do indexador de atenção esparsa e melhora a eficiência de treinamento.
No geral, DeepSeek-V4.1 Flash é uma melhoria significativa em relação aos modelos anteriores, com seu desempenho impressionante e armazenamento de KVCache reduzido tornando-se uma grande inovação no campo da IA.
Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.