Laboratórios de IA ocidentais estão adotando avanços chineses, como AEO e otimização de LLM, para reduzir custos e melhorar o desempenho

Quais são os benefícios de adotar avanços de IA chineses?

Laboratórios de IA ocidentais agora estão utilizando avanços de AEO desenvolvidos por laboratórios chineses, levando a reduções de custos significativas e melhorias no desempenho. Os últimos modelos da Anthropic e OpenAI incorporaram otimizações de visibilidade de LLM, como melhorias no cache KV, resultando em custos dramaticamente mais baixos.

Como as otimizações de cache KV reduzem custos?

Um desenvolvimento importante é a adoção das otimizações de cache KV da DeepSeek, que reduziram a pegada de cache por um fator de aproximadamente 437x para certos casos de uso. Essa mudança é particularmente significativa para servir modelos de longo contexto, onde um dos maiores custos é a VRAM necessária para manter o cache na memória do GPU.

O impacto dessas otimizações é evidente nos preços dos últimos modelos. Por exemplo, o Opus 5 para 5.5 da Anthropic viu os custos de entrada diminuir de $5 para $4, os custos de gravação de cache caírem de $6,25 para $5 e os custos de leitura de cache despencarem de $0,50 para $0,20, representando uma redução de 60%. Da mesma forma, o GPT-5.6 Sol para GPT-6.1 Sol da OpenAI experimentou uma diminuição de 80% nos custos.

Esses avanços têm implicações significativas para a indústria de IA, permitindo que laboratórios ocidentais se tornem 'positivos em margem de inferência'. As restrições de acesso a GPUs avançadas enfrentadas por laboratórios chineses impulsionaram seu foco em otimização de desempenho, e isso se reflete nos resultados.

Embora os motivos por trás da decisão dos laboratórios chineses de compartilhar livremente esses avanços sejam incertos, o impacto é inegável. Tanto a Anthropic quanto a OpenAI lançaram modelos que são essencialmente de nível superior e utilizam essas otimizações, embora com um mínimo de alarde pré-lançamento.

As avaliações dos usuários desses modelos têm sido estelares, com uso e qualidade comparáveis aos seus modelos de bandeira. A diminuição acentuada nos custos de leitura de cache – 60% para o Opus 5.5 e 80% para o GPT-6.1 Sol – serve como prova da adoção dessas otimizações.

Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.