Os preços dos tokens para modelos de linguagem grande caíram de aproximadamente $20 por milhão de tokens no final de 2022 para cerca de $0,40 hoje – uma queda de 98%. Paradoxalmente, os gastos em inteligência artificial empresarial explodiram, com análises da indústria estimando um aumento de 320% nas contas desde a queda dos preços. O aumento se deve à adoção rápida de ferramentas de IA agênticas que multiplicam o consumo de tokens por tarea.

O Claude Opus 4.5 da Anthropic, o GPT-5.1 da OpenAI e o Gemini 3 Pro do Google, lançados após novembro de 2025, transformaram fluxos de trabalho de uma etapa em sistemas agênticos orquestrados. Onde uma interação linear custava $0,04 em 2023, o mesmo processo agora custa cerca de $1,20 – um salto de trinta vezes. O uso de tokens por desenvolvedor aumentou cerca de 18,6 vezes em nove meses, segundo Nicholas Arcolano, chefe de pesquisa da Jellyfish. Os usuários intensivos de tokens relatam ganhos de produtividade, mas gastam dez vezes mais tokens do que os usuários leves.

O excesso de gastos já é uma realidade. A Uber esgotou todo o seu orçamento de codificação de IA para 2026 em abril. A Microsoft revogou licenças de desenvolvedores do Claude Code seis meses após concedê-las. Uma empresa não identificada acumulou uma conta de $500 milhões do Claude em um mês após esquecer de definir limites de uso. O diretor financeiro sênior de TI da Priceline, Chris Reed, disse que uma renovação de contrato rotineira com a ferramenta Cursor retornou quatro a cinco vezes o custo anterior.

"Seis meses atrás, eu teria uma conversa com um cliente sobre 'O que ele pode fazer?' Hoje é 'Estamos gastando tanto. Qual é a visibilidade que temos?'" disse Alexander Embiricos, chefe de empresa da OpenAI. J.R. Storment, diretor executivo da FinOps Foundation, ecoou a mudança: "A conversa mudou de 'maximizar tokens' e 'ir rápido' para 'precisamos de guardrails, como controlamos isso?'"

Para lidar com a crescente pressão financeira, a Linux Foundation divulgou planos para a Fundação Tokenomics. O novo órgão de padronização visa definir "tokenômica", publicar padrões abertos para uso e faturamento de tokens de IA e introduzir métricas como custo por inteligência e tokens por watt. Um lançamento formal está previsto para julho. Nishant Gupta, chefe de disponibilidade da Salesforce, alertou que "a economia de tokens é fundamentalmente mais abstrata e opaca do que qualquer coisa que tenhamos gerenciado em esta escala antes".

Jogadores da indústria já estão correndo para preencher a lacuna. Startups como Pay-i e Paid oferecem otimização de gastos em IA e faturamento baseado em valor. Empresas como Jellyfish, Waydev e Faros AI fornecem monitoramento para provar o ROI em ferramentas de desenvolvedor. Plataformas de observabilidade maiores – Datadog e New Relic – adicionaram métricas de nível de token. O roteamento de modelos está surgindo como um principal controle de custos; a Factory, uma startup de codificação de IA empresarial, introduziu um roteador que seleciona automaticamente o modelo mais barato adequado para cada tarea.

O Goldman Sachs projeta que o uso global de tokens multiplicará 24 vezes até 2030. Para as empresas que já estão acima do orçamento, soluções são necessárias agora, mesmo que os primeiros deliverables da Fundação Tokenomics ainda estejam meses à frente. Como disse Vitaly Gordon, CEO da Faros AI, "Talvez tenhamos criado uma máquina a vapor, mas ainda não descobrimos a linha de montagem".

Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.