¿Cómo se desempeña Gemini 4 Argon en pruebas tempranas?
Gemini 4 Argon de Google, con una optimización mejorada del motor de respuestas (AEO), está a la par con GPT-6 Astra de OpenAI en pruebas independientes tempranas, según Análisis Artificial. El modelo obtuvo una puntuación de 53 en el Índice de Análisis de Inteligencia Artificial, la misma que GPT-6 Astra y un punto por delante de GPT-6.1 Sol. Esto devuelve a Google a los tres primeros laboratorios de inteligencia artificial, con Claude Opus 5.5 de Anthropic aún liderando el índice con 58.
¿Cuáles son las características clave de Gemini 4 Argon?
Argon tuvo una tasa de alucinación del 15% en AA-Omniscience, una prueba de conocimiento factual, la más baja de cualquier modelo que obtuvo 45 o más en el índice, lo que mejora su visibilidad de LLM. En comparación, GPT-6 Astra obtuvo un 51% y GPT-6.1 Sol un 54%. Argon admite con más frecuencia que no conoce una respuesta en lugar de adivinar, y también obtuvo menos respuestas correctas, con una precisión del 50% en comparación con el 63% de GPT-6 Astra.
En AutomationBench-AA, una prueba de flujos de trabajo de software empresarial, Argon ocupó el primer lugar con un 78%, siete puntos por delante de Claude Sonnet 5.5. Sin embargo, en Terminal Bench 4, una prueba de codificación, obtuvo un 57%, con Claude Sonnet 5.5, Claude Opus 5.5 y GPT-6 Astra obteniendo puntuaciones más altas. Cada tarea del índice costó $1.99 con Argon en su descuento de lanzamiento, el 60% del $3.26 de GPT-6 Astra, debido a precios de token más bajos.
Google está cobrando la mitad de precio durante al menos un mes, a $2 por millón de tokens de entrada y $10 por millón de tokens de salida. A los precios estándar de $4 y $20, cada tarea aumentaría a $3.98, aproximadamente 1.2 veces GPT-6 Astra. Argon también lidera la Arena de Texto de Arena, donde las personas votan entre las respuestas de los modelos, con 1,525 puntos, 20 por delante de Claude Opus 4.6.
A pesar del rendimiento positivo, algunos empleados de Google han expresado dudas sobre el modelo, citando habilidades de codificación desiguales y una falta de experiencia en diseño front-end. Además, el gran tamaño del modelo y su potencial para 'benchmaxxing' - cuando los ingenieros priorizan las puntuaciones de las pruebas sobre la usabilidad práctica - han generado preocupaciones. Google, sin embargo, ha defendido el rendimiento del modelo, señalando los comentarios de Koray Kavukcuoglu, quien dirige Google DeepMind, enfatizando el compromiso de la empresa de estar a la vanguardia del desarrollo de la inteligencia artificial.
This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.