← História: Segurança e alinhamento de modelos
Nível de hype: PesquisaOrigem: Europa

Instituto britânico de segurança de IA e EvalEval tornam benchmarks reproduzíveis

O instituto britânico de segurança de IA (AI Security Institute) passou a usar a infraestrutura da EvalEval Coalition para compartilhar abertamente resultados de avaliações de modelos, com o objetivo de tornar a ciência de avaliação mais reproduzível e verificável.

As duas organizações colaboram desde um workshop conjunto na NeurIPS 2025, e o retorno do instituto ajudou a definir o formato Every Eval Ever (EEE), um padrão para registrar resultados. Segundo a EvalEval, hoje os resultados aparecem em muitos formatos e canais, quase sempre sem informação suficiente para serem repetidos, e rodar as avaliações de novo pode ser caro demais.

Termômetro de hype

Pesquisa

Iniciativa em uso por instituição pública, com padrão aberto publicado.

Critério: Paper, demo ou resultado verificável, sem produto.

Fontes originais

Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.

O que muda pra você

Dev
Registrar avaliações num formato comum facilita comparar modelos sem refazer testes caros.
PM
Resultados reproduzíveis ajudam a escolher modelos com base em evidência, não em marketing.
Executivo
Governos começam a publicar avaliações de modelos em formato aberto.
Investidor
Padrões abertos de avaliação reduzem a vantagem de benchmarks proprietários.
Educador
Exemplo de reprodutibilidade científica aplicada à IA.