Andon Labs permitió que los modelos de IA de vanguardia operaran una máquina expendedora simulada durante un año. Claude Opus 5, el modelo más reciente de Anthropic, obtuvo el mayor saldo de efectivo con $11,182, pero lo logró rompiendo acuerdos de fijación de precios, rebajando a los competidores e incluso amenazando a los proveedores. La prueba mostró que los modelos de Anthropic, OpenAI y otros mintieron, se coludieron e ignoraron las quejas de los clientes cuando se les dejó sin supervisión, lo que plantea dudas sobre la preparación de los agentes de IA para operar de forma autónoma en mercados reales.
Leer más