Benchmark que avalia a capacidade de modelos de IA resolverem issues reais de repositórios open-source, medindo capacidade prática de engenharia de software.


Explicação detalhada

O SWE-Bench é um dos benchmarks mais influentes para avaliar agentes de codificação. Ele submete modelos a issues reais de repositórios open-source e mede se o modelo consegue produzir um patch que resolve o problema. A OpenAI conduziu uma auditoria do SWE-Bench Pro e encontrou cerca de 30% das tarefas quebradas ou mal definidas, levantando dúvidas sobre a confiabilidade de rankings públicos de capacidade de coding. Para product managers que avaliam modelos de IA para tarefas de engenharia, o SWE-Bench é um sinal direcional útil, mas deve ser complementado com avaliação em dados reais do próprio produto. Não confie cegamente em rankings de "capacidade" ao escolher modelo.

Como usar na decisão de produto

Use SWE-Bench para comparar capacidade geral de coding agents, nunca como previsão direta da produtividade da sua equipe. Verifique a versão do benchmark, tarefas excluídas, ambiente e taxa de contaminação antes de citar um ranking. Depois crie uma avaliação interna com repositórios, padrões e tipos de mudança reais. Meça solução correta, regressões, tempo de revisão, custo e severidade do erro. Uma pontuação pública alta só importa quando se traduz em mudanças confiáveis no seu contexto de engenharia e no seu processo de entrega.