Cientistas da Alemanha e uma empresa de segurança dos EUA mostraram que o "pensamento" interno de grandes modelos de linguagem pode ser extraído dos fluxos de dados criptografados que alimentam as chamadas de API. Ao alimentar a mesma chave de descriptografia com uma versão menor e menos alinhada de um modelo, os pesquisadores conseguiram reconstruir o raciocínio passo a passo que as empresas normalmente mantêm oculto.
A vulnerabilidade abrange os principais provedores de fronteira testados – OpenAI, Anthropic e Google – e pode expor informações sensíveis incorporadas no cálculo de um modelo, incluindo senhas e chaves de API. Depois que a equipe alertou as empresas no mês passado, as três emitiram mitigações de curto prazo que bloqueiam o ataque de reprodução específico. Google e OpenAI se recusaram a comentar, enquanto Anthropic disse que valoriza a pesquisa independente e começou a construir soluções.
Além do ângulo de segurança, o método revelou uma semelhança inesperada entre o raciocínio oculto de modelos proprietários e a saída de um modelo de peso aberto chinês, Kimi K3, desenvolvido pela Moonshot AI. Quando os pesquisadores alimentaram Kimi K3 com as primeiras palavras de um traço de raciocínio capturado de Claude Opus 4.8 ou GPT 5.6, o modelo frequentemente reproduziu uma resposta notavelmente semelhante. Dois outros modelos de peso aberto – DeepSeek e Inkling – não mostraram esse padrão.
A descoberta alimenta um debate de longa data sobre a destilação de modelos, uma técnica que copia capacidades de um modelo grande e fechado para um modelo menor e baixável. Legisladores dos EUA ouviram acusações de que empresas chinesas usam a destilação para replicar modelos avançados dos EUA. OpenAI disse a um painel congressional que DeepSeek parece ter copiado um de seus modelos, e Anthropic alegou que Alibaba sistematicamente destilou sua tecnologia para construir Qwen.
Embora o novo estudo não prove que Kimi K3 foi construído diretamente pela destilação de Claude ou GPT, demonstra que o raciocínio extraído poderia tornar essa cópia mais fácil. "A ideia de trocar mensagens para uma variante de modelo mais fraca que tem a mesma chave de descriptografia, mas alinhamento mais fraco, é muito legal", disse Florian Tramer, um pesquisador de segurança do ETH Zürich.
Especialistas alertam que o impacto mais amplo da destilação na corrida de IA permanece incerto. Kyle Miller, do Centro de Segurança e Tecnologias Emergentes, observou que, mesmo que laboratórios chineses reduzissem a destilação, sua capacidade de construir modelos de ponta a partir do zero provavelmente manteria o equilíbrio competitivo em grande parte inalterado. Yarin Gal, da Universidade de Oxford, acrescentou que a destilação acelera o progresso em toda a área e que proibições gerais poderiam retardar a inovação.
O CEO da Meta, Mark Zuckerberg, defendeu recentemente a prática, chamando-a de "um princípio importante de como o ecossistema de código aberto funciona" e alertando que restrições poderiam prejudicar os EUA.
Por enquanto, a preocupação imediata é a capacidade persistente de vislumbrar traços de raciocínio, mesmo após as soluções. Panfilov, o autor principal do estudo, afirma que uma reformulação fundamental dos designs de API seria necessária para fechar a lacuna completamente. As empresas continuam a monitorar a questão à medida que os modelos de IA se tornam cada vez mais integrais às operações comerciais e governamentais.
This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.