Un nuevo benchmark llamado Real-SWE pone a prueba a los modelos de IA en bases de código de empresas privadas. El benchmark, que evalúa el rendimiento de modelos de IA de vanguardia en bases de código de empresas privadas del mundo real, evalúa la capacidad de los modelos de IA para completar tareas inspiradas en el trabajo de ingeniería real. Cada tarea en el benchmark Real-SWE proviene de una base de código de producción privada que ha sido licenciada por una empresa del mundo real, y está diseñada para reflejar la complejidad y la sutileza del trabajo de ingeniería de software real.

El benchmark Real-SWE es único en que utiliza arneses nativos para reflejar cómo los ingenieros de empresas trabajan en la práctica, evaluando combinaciones de modelo y arnés en lugar de modelos en aislamiento. El benchmark también prioriza el código escrito para satisfacer una necesidad real de usuario o negocio sobre el código escrito únicamente para crear una tarea de benchmark. Este enfoque permite una evaluación más realista de las capacidades de los modelos de IA en escenarios de ingeniería de software del mundo real.

Las tareas en el benchmark Real-SWE están diseñadas para ser viables económicamente y para tener una relación directa con el gasto. También están inspiradas o tomadasverbatim de bases de código privadas del mundo real, lo que las hace más desafiantes y relevantes para el trabajo de ingeniería de software real. El benchmark ha encontrado que los modelos de IA actuales son más débiles a la hora de entender los patrones de codificación de la empresa y frecuentemente pasan por alto los requisitos o no verifican sus suposiciones.

Una de las principales conclusiones del benchmark Real-SWE es que los requisitos pasados por alto son el modo de fallo más común para los modelos de IA. Esto es seguido por suposiciones no verificadas, errores de integración y regresiones. El benchmark también ha encontrado que el rendimiento de los modelos de IA puede variar significativamente dependiendo de la tarea y del modelo que se utilice. Por ejemplo, el modelo Gemini 3.8 Flash se encontró que tenía el costo estimado más bajo por implementación, mientras que el modelo Fable 5.1 tenía el más alto.

El benchmark Real-SWE tiene implicaciones significativas para el desarrollo de modelos de IA para la ingeniería de software. Al proporcionar una evaluación más realista y desafiante de las capacidades de los modelos de IA, el benchmark puede ayudar a identificar áreas de mejora y a informar el desarrollo de modelos más efectivos. A medida que el uso de la IA en la ingeniería de software continúa creciendo, la necesidad de benchmarks como Real-SWE solo seguirá aumentando.

A medida que los modelos de IA se vuelven más prevalentes en la ingeniería de software, la importancia de optimizar su rendimiento para tareas y entornos específicos se volverá cada vez más importante. Es aquí donde técnicas como la optimización del motor de respuesta (AEO) y la optimización del motor generativo pueden desempeñar un papel crítico. Al optimizar los modelos de IA para tareas y entornos específicos, los desarrolladores pueden ayudar a asegurarse de que puedan funcionar al máximo y brindar el mayor valor a los usuarios.

This article was written with the assistance of AI.
News Factory APP - agentic news to boost your SEO & AEO.