A unidade de pesquisa de inteligência artificial da Alibaba anunciou o modelo de pré-visualização Qwen3.8-Flash-Next na quinta-feira, oferecendo uma visão da arquitetura que planeja escalar para o futuro modelo Qwen4. O modelo contém 125 bilhões de parâmetros, mas dispara apenas 6 bilhões para cada token que gera, uma escolha de design deliberada visando reduzir os custos de inferência à medida que as cargas de trabalho de contexto amplo e agente se tornam comuns.

Em comparação com o modelo de bandeira anterior da equipe, o Qwen3.7-Plus, que possui 397 bilhões de parâmetros e ativa 17 bilhões por token, o novo sistema opera com aproximadamente um terço do cômputo ativo. O ganho de eficiência decorre de três ajustes convencionais e uma adição não convencional.

As três primeiras alterações são familiares à comunidade de LLM. O Qwen3.8-Flash-Next emprega um novo mecanismo de atenção esparsa que opera em micro-blocos em vez de selecionar tokens individuais, reduzindo o número de cálculos de atenção. Um caminho residual com portão controla o fluxo de informações entre as camadas, e a receita de treinamento elimina o aquecimento do tamanho do lote, simplificando o processo de otimização.

A quarta modificação se desvia dos projetos de camada de especialista típicos. Em vez de adicionar mais especialistas especializados, o modelo anexa uma matriz de incorporação de 51 bilhões de parâmetros indexada por fragmentos de dois e três caracteres. De acordo com a equipe Qwen, essa abordagem reduz a sobrecarga computacional e facilita a descarga para aceleradores com memória limitada, uma resposta prática às restrições de controle de exportação que limitaram o acesso dos laboratórios chineses a chips de nível superior.

Os benchmarks da própria Alibaba apoiam as alegações de desempenho, embora a verificação externa ainda esteja pendente. A empresa anteriormente havia divulgado o Qwen3.8 como o segundo melhor modelo do mundo, uma afirmação relatada por The Next Web sem prova independente. O cartão do modelo também observa que sua pontuação no exame final da Humanidade foi avaliada pelo GPT-4o em vez do avaliador oficial do benchmark, um movimento de transparência que sinaliza relatórios candidos, mas não substitui a avaliação de terceiros.

Os detalhes da licença podem moldar a adoção do modelo na Europa. Os pesos do Qwen3.8-Flash-Next são hospedados no Hugging Face sob uma licença "qwen-comunidade" que permite o uso comercial para grandes clientes em troca de taxas. O Ato de IA da Europa distingue entre software verdadeiramente gratuito e de código aberto e versões que monetizam componentes; o Artigo 53(2) e o Recital 103 sugerem que o modelo baseado em taxas pode não se qualificar para a isenção que alivia os desenvolvedores de certas obrigações de documentação.

As empresas europeias parecem não estar desanimadas. A Thomson Reuters, por exemplo, já construiu um modelo proprietário em cima do Qwen, significando que qualquer mudança futura de licenciamento afetará os usuários downstream. A indústria está observando de perto à medida que os reguladores decidem se a licença Qwen atende aos critérios de código aberto do Ato de IA.

Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.