Nível de hype: PesquisaOrigem: EUA
OpenAI aponta problemas no benchmark de programação SWE-Bench Pro
Uma análise da OpenAI aponta problemas no SWE-Bench Pro, benchmark popular de programação, levantando dúvidas sobre a confiabilidade e a precisão do teste para avaliar modelos.
O texto completo não pôde ser lido, por isso não há detalhes sobre os problemas encontrados.
Pesquisa
Análise publicada pela empresa.
Critério: Paper, demo ou resultado verificável, sem produto.
Fontes originais
Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.
O que muda pra você
- Dev
- Não escolha modelo de código só por placar de benchmark.
- PM
- Teste modelos nas suas próprias tarefas.
- Executivo
- Benchmarks públicos têm falhas; exija avaliações próprias.
- Investidor
- Sem efeito direto para investidores.
- Educador
- Explique os limites de benchmarks.