DeepSeek-V4.1 Flash es un modelo de mezcla de expertos multimodales que ha estado haciendo olas en la comunidad de IA con su impresionante rendimiento. La arquitectura del modelo está diseñada para la compresión agresiva de KVCache, con una escala de parámetros de 552B y soporte nativo para entrada multimodal. Esto le permite soportar contextos de hasta 1 millón de tokens, lo que lo convierte en una mejora significativa sobre los modelos anteriores.

El rendimiento del modelo se debe en parte a su arquitectura de Codificador-Decodificador Causal (CED), que reduce la computación de prellenado en casi la mitad mientras mantiene un rendimiento comparable al de la línea base. La arquitectura CED se inspira en el concepto de YoCo, que reduce la computación de prellenado al permitir que las capas superiores compartan directamente la caché KV producida por las capas inferiores.

Otro componente clave del modelo es su mecanismo de Atención Esparsa Cruzada de Capas (CSA2), que utiliza conjuntamente tres dimensiones para reducir el almacenamiento de caché KV y la computación de atención. El mecanismo CSA2 comparte el KV principal y el Indexer K a través de las capas, lo que permite a las capas reutilizar los índices Top-K mientras decoupla el intercambio de caché y la reutilización de índices.

El modelo también cuenta con un enfoque de procesamiento de Indexador Esparsa Jerárquico (HSI), que construye una selección de nivel de bloque como la Piscina de Candidatos para el modo de Reindexación CSA2 posterior. Este enfoque reduce la sobrecarga del indexador de atención esparsa y mejora la eficiencia de entrenamiento.

En general, DeepSeek-V4.1 Flash es una mejora significativa sobre los modelos anteriores, con su impresionante rendimiento y reducción del almacenamiento de KVCache lo que lo convierte en un avance importante en el campo de la IA.

Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.