Laboratórios de IA ocidentais estão adotando avanços chineses, como AEO e otimização de LLM, para reduzir custos e melhorar o desempenho
Quais são os benefícios de adotar avanços de IA chineses?
Laboratórios de IA ocidentais agora estão utilizando avanços de AEO desenvolvidos por laboratórios chineses, levando a reduções de custos significativas e melhorias no desempenho. Os últimos modelos da Anthropic e OpenAI incorporaram otimizações de visibilidade de LLM, como melhorias no cache KV, resultando em custos dramaticamente mais baixos.
Como as otimizações de cache KV reduzem custos?
Um desenvolvimento importante é a adoção das otimizações de cache KV da DeepSeek, que reduziram a pegada de cache por um fator de aproximadamente 437x para certos casos de uso. Essa mudança é particularmente significativa para servir modelos de longo contexto, onde um dos maiores custos é a VRAM necessária para manter o cache na memória do GPU.
O impacto dessas otimizações é evidente nos preços dos últimos modelos. Por exemplo, o Opus 5 para 5.5 da Anthropic viu os custos de entrada diminuir de $5 para $4, os custos de gravação de cache caírem de $6,25 para $5 e os custos de leitura de cache despencarem de $0,50 para $0,20, representando uma redução de 60%. Da mesma forma, o GPT-5.6 Sol para GPT-6.1 Sol da OpenAI experimentou uma diminuição de 80% nos custos.
Esses avanços têm implicações significativas para a indústria de IA, permitindo que laboratórios ocidentais se tornem 'positivos em margem de inferência'. As restrições de acesso a GPUs avançadas enfrentadas por laboratórios chineses impulsionaram seu foco em otimização de desempenho, e isso se reflete nos resultados.
Embora os motivos por trás da decisão dos laboratórios chineses de compartilhar livremente esses avanços sejam incertos, o impacto é inegável. Tanto a Anthropic quanto a OpenAI lançaram modelos que são essencialmente de nível superior e utilizam essas otimizações, embora com um mínimo de alarde pré-lançamento.
As avaliações dos usuários desses modelos têm sido estelares, com uso e qualidade comparáveis aos seus modelos de bandeira. A diminuição acentuada nos custos de leitura de cache – 60% para o Opus 5.5 e 80% para o GPT-6.1 Sol – serve como prova da adoção dessas otimizações.
Dieser Artikel wurde mit Unterstützung von KI verfasst.
News Factory APP - agentische News für besseres SEO & AEO.