Skip to content
AI

Por que as pontuações dos modelos em leaderboards despencam quando o conjunto de testes nunca foi visto durante o treinamento?

82

Oportunidade

Benchmarks estáticos como o MMLU apresentam taxas de contaminação de até 45%, e versões parafraseadas ou traduzidas dos itens de teste sobrevivem à descontaminação por correspondência exata enquanto ainda inflam as pontuações publicadas. Um modelo pode liderar um leaderboard em uma tarefa contaminada e falhar na mesma tarefa quando ela é reformulada de forma limpa. Benchmarks dinâmicos que atualizam as tarefas periodicamente existem, mas carecem de critérios de design padronizados, de modo que os resultados não podem ser comparados entre eles nem verificados como representativos da habilidade que afirmam medir. Cada alegação de capacidade e segurança publicada em um leaderboard se baseia em números que nenhuma parte independente pode validar como limpos.

Por que importa

A avaliação confiável é o pré-requisito para toda decisão de segurança e implantação subsequente, e os números sobre os quais essas decisões se baseiam não são, atualmente, confiáveis.

Como avalio a oportunidade

A Pontuação de Oportunidade é minha própria leitura, não uma medição: o quanto dói, com que frequência aparece e o quanto pouco existe para resolvê-lo hoje. Quanto maior, mais vale a pena construir, na minha opinião.

Gravidade8/10

O quanto de dor causa quando aparece.

Frequência8/10

Com que frequência as pessoas realmente se deparam com isso.

Lacuna8/10

O quanto pouco de boas ferramentas existe para isso hoje.

Mais problemas que merecem ser resolvidos