Um novo benchmarck chamado Real-SWE está colocando modelos de IA à prova em codebases de empresas privadas. O benchmarck, que avalia o desempenho de modelos de IA de ponta em codebases de empresas privadas do mundo real, avalia a capacidade dos modelos de IA de concluir tarefas inspiradas no trabalho de engenharia real. Cada tarefa no benchmarck Real-SWE vem de um codebase de produção privado que foi licenciado de uma empresa do mundo real, e é projetado para refletir a complexidade e a nuances do trabalho de engenharia de software real.

O benchmarck Real-SWE é único porque usa harnesses nativos para refletir como os engenheiros de empresas trabalham na prática, avaliando combinações de modelo e harness em vez de modelos isolados. O benchmarck também prioriza o código escrito para atender a uma necessidade real de usuário ou negócio sobre o código escrito apenas para criar uma tarefa de benchmarck. Essa abordagem permite uma avaliação mais realista das capacidades dos modelos de IA em cenários de engenharia de software do mundo real.

As tarefas no benchmarck Real-SWE são projetadas para serem economicamente viáveis e ter uma relação direta com o gasto. Elas também são inspiradas ou copiadas verbatim de codebases privados do mundo real, tornando-as mais desafiadoras e relevantes para o trabalho de engenharia de software real. O benchmarck descobriu que os modelos de IA atuais são mais fracos em entender os padrões de codificação da empresa e frequentemente perdem requisitos ou não verificam suas suposições.

Uma das principais descobertas do benchmarck Real-SWE é que os requisitos perdidos são o modo de falha mais comum para os modelos de IA. Isso é seguido por suposições não verificadas, erros de integração e regressões. O benchmarck também descobriu que o desempenho dos modelos de IA pode variar significativamente dependendo da tarefa e do modelo sendo usado. Por exemplo, o modelo Gemini 3.8 Flash foi encontrado para ter o custo estimado mais baixo por rollout, enquanto o modelo Fable 5.1 teve o mais alto.

O benchmarck Real-SWE tem implicações significativas para o desenvolvimento de modelos de IA para engenharia de software. Ao fornecer uma avaliação mais realista e desafiadora das capacidades dos modelos de IA, o benchmarck pode ajudar a identificar áreas para melhoria e informar o desenvolvimento de modelos mais eficazes. À medida que o uso de IA em engenharia de software continua a crescer, a necessidade de benchmarcks como o Real-SWE apenas continuará a aumentar.

À medida que os modelos de IA se tornam mais prevalentes em engenharia de software, a importância de otimizar seu desempenho para tarefas e ambientes específicos se tornará cada vez mais importante. É aqui que técnicas como otimização de motor de resposta (AEO) e otimização de motor gerador podem desempenhar um papel crítico. Ao otimizar os modelos de IA para tarefas e ambientes específicos, os desenvolvedores podem ajudar a garantir que eles sejam capazes de performar ao seu melhor e fornecer o maior valor aos usuários.

Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.