La unidad de investigación de inteligencia artificial de Alibaba anunció el modelo de vista previa Qwen3.8-Flash-Next el jueves, ofreciendo una visión de la arquitectura que planea escalar para el próximo Qwen4. El modelo cuenta con 125 mil millones de parámetros, pero saja solo 6 mil millones por cada token que genera, una elección de diseño deliberada destinada a reducir los costos de inferencia a medida que se vuelven comunes las cargas de trabajo de contexto grande y agente.

En comparación con el buque insignia anterior del equipo, Qwen3.7-Plus, que tiene 397 mil millones de parámetros y activa 17 mil millones por token, el nuevo sistema funciona con aproximadamente un tercio del cálculo activo. La ganancia de eficiencia se debe a tres ajustes convencionales y una adición no convencional.

Los tres primeros cambios son familiares para la comunidad de LLM. Qwen3.8-Flash-Next emplea un nuevo mecanismo de atención dispersa que opera en microbloques en lugar de seleccionar tokens individuales, reduciendo el número de cálculos de atención. Una vía residual controlada controla el flujo de información entre capas y la receta de entrenamiento elimina el calentamiento de tamaño de lote, simplificando el proceso de optimización.

La cuarta modificación se desvía de los diseños de capas de expertos típicos. En lugar de agregar más expertos especializados, el modelo adjunta una matriz de incrustación de 51 mil millones de parámetros indexada por fragmentos de dos y tres caracteres. Según el equipo Qwen, este enfoque reduce la sobrecarga computacional y facilita la descarga a aceleradores con memoria limitada, una respuesta práctica a las restricciones de control de exportación que han limitado el acceso de los laboratorios chinos a los chips de nivel superior.

Las propias pruebas de Alibaba respaldan las afirmaciones de rendimiento, aunque la verificación externa sigue pendiente. La empresa previamente facturó Qwen3.8 como el segundo mejor modelo del mundo, una afirmación informada por The Next Web sin prueba independiente. La tarjeta del modelo también señala que su puntuación en el examen final de la humanidad fue calificada por GPT-4o en lugar del calificador oficial de la prueba, un movimiento de transparencia que señala la informe honesto pero no reemplaza la evaluación de terceros.

Los detalles de licencia podrían moldear la adopción del modelo en Europa. Los pesos de Qwen3.8-Flash-Next se alojan en Hugging Face bajo una licencia de "qwen-comunidad" que permite el uso comercial para grandes clientes a cambio de tarifas. La Ley de IA de la UE distingue entre software verdaderamente gratuito y de código abierto y versiones que monetizan componentes; el Artículo 53(2) y el Considerando 103 sugieren que el modelo basado en tarifas puede no calificar para la exención que exime a los desarrolladores de ciertas obligaciones de documentación.

Las empresas europeas parecen no estar disuadidas. Thomson Reuters, por ejemplo, ya ha construido un modelo propietario sobre Qwen, lo que significa que cualquier cambio futuro en la licencia afectará a los usuarios downstream. La industria está observando de cerca cómo los reguladores deciden si la licencia de Qwen satisface los criterios de código abierto de la Ley de IA.

This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.