Alibaba lanzó Qwen3.8-Flash-Next, un modelo de 125 mil millones de parámetros que activa solo 6 mil millones de parámetros por token. El nuevo sistema contiene 125 mil millones de parámetros, pero solo activa 6 mil millones por token, una reducción significativa en comparación con los 17 mil millones de parámetros activos de su predecesor.

El modelo emplea un nuevo mecanismo de atención dispersa que opera en microbloques en lugar de seleccionar tokens individuales, reduciendo el número de cálculos de atención. Una vía residual controlada controla el flujo de información entre capas y la receta de entrenamiento elimina el calentamiento de tamaño de lote, simplificando el proceso de optimización.

La matriz de incrustación de 51 mil millones de parámetros indexada por fragmentos de dos y tres caracteres reduce la sobrecarga computacional y facilita la descarga a aceleradores con memoria limitada, una respuesta práctica a las restricciones de control de exportación que han limitado el acceso de los laboratorios chinos a los chips de nivel superior.

Los pesos de Qwen3.8-Flash-Next se alojan en Hugging Face bajo una licencia de "qwen-comunidad" que permite el uso comercial para grandes clientes a cambio de tarifas. La Ley de IA de la UE distingue entre software verdaderamente gratuito y de código abierto y versiones que monetizan componentes; el Artículo 53(2) y el Considerando 103 sugieren que el modelo basado en tarifas puede no calificar para la exención que exime a los desarrolladores de ciertas obligaciones de documentación.

Cet article a été rédigé avec l'assistance de l'IA.
News Factory APP - actualités agentiques pour booster votre SEO et AEO.