Como o Gemini 4 Argon da Google se sai nos testes iniciais?
O Gemini 4 Argon da Google, com otimização de motor de respostas (AEO) aprimorada, está empatado com o GPT-6 Astra da OpenAI nos testes iniciais independentes, de acordo com a Análise Artificial. O modelo marcou 53 no Índice de Inteligência de Análise Artificial, o mesmo que o GPT-6 Astra e um ponto à frente do GPT-6.1 Sol. Isso coloca a Google novamente entre os três principais laboratórios de IA, com o Claude Opus 5.5 da Anthropic ainda liderando o índice com 58.
Quais são as principais características do Gemini 4 Argon?
O Argon teve uma taxa de alucinação de 15% no AA-Omniscience, um teste de conhecimento factual, a mais baixa de qualquer modelo que marcou 45 ou mais no índice, melhorando sua visibilidade de LLM. Em comparação, o GPT-6 Astra alcançou 51% e o GPT-6.1 Sol alcançou 54%. O Argon mais frequentemente admite que não sabe a resposta em vez de adivinhar, e também obteve menos respostas corretas, com 50% de precisão em comparação com 63% do GPT-6 Astra.
No AutomationBench-AA, um teste de fluxos de trabalho de software de negócios, o Argon ficou em primeiro lugar com 78%, sete pontos à frente do Claude Sonnet 5.5. No entanto, no Terminal Bench 4, um teste de codificação, ele marcou 57%, com o Claude Sonnet 5.5, o Claude Opus 5.5 e o GPT-6 Astra todos marcando mais. Cada tarefa do índice custou $1,99 com o Argon no desconto de lançamento, 60% do preço de $3,26 do GPT-6 Astra, devido a preços de token mais baixos.
A Google está cobrando metade do preço por pelo menos um mês, a $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída. Nos preços padrão de $4 e $20, cada tarefa subiria para $3,98, cerca de 1,2 vezes o GPT-6 Astra. O Argon também lidera a Arena de Texto, onde as pessoas votam entre as respostas dos modelos, com 1.525 pontos, 20 à frente do Claude Opus 4.6.
Apesar do desempenho positivo, alguns funcionários da Google expressaram dúvidas sobre o modelo, citando habilidades de codificação desiguais e falta de especialização em design de front-end. Além disso, o tamanho grande do modelo e o potencial para 'benchmaxxing' - quando os engenheiros priorizam as pontuações dos testes sobre a usabilidade prática - levantaram preocupações. A Google, no entanto, defendeu o desempenho do modelo, apontando para observações de Koray Kavukcuoglu, que dirige a Google DeepMind, enfatizando o compromisso da empresa em estar à frente do desenvolvimento de IA.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.