Skip to content
AI

Pourquoi les scores des classements de modèles s'effondrent-ils lorsque l'ensemble de test n'a jamais été vu à l'entraînement ?

82

Opportunité

Les benchmarks statiques comme MMLU présentent des taux de contamination pouvant atteindre 45 %, et les versions paraphrasées ou traduites des éléments de test survivent à la décontamination par correspondance exacte tout en continuant à gonfler les scores publiés. Un modèle peut dominer un classement sur une tâche contaminée et échouer sur la même tâche lorsqu'elle est reformulée proprement. Des benchmarks dynamiques qui actualisent périodiquement les tâches existent, mais ils manquent de critères de conception standardisés, de sorte que les résultats ne peuvent pas être comparés entre eux ni vérifiés comme représentatifs de la compétence qu'ils prétendent mesurer. Toute affirmation de capacité ou de sécurité publiée dans un classement repose sur des chiffres qu'aucune partie indépendante ne peut valider comme étant propres.

Pourquoi c'est important

Une évaluation digne de confiance est le prérequis pour toute décision de sécurité et de déploiement en aval, et les chiffres sur lesquels reposent ces décisions ne sont pas actuellement fiables.

Comment j'évalue l'opportunité

Le Score d'Opportunité est mon évaluation personnelle, pas une mesure : l'intensité de la douleur, sa fréquence et le peu de solutions qui existent aujourd'hui. Plus il est élevé, plus je pense que le problème vaut la peine d'être résolu.

Gravité8/10

L'intensité de la douleur qu'il provoque lorsqu'il se manifeste.

Fréquence8/10

La fréquence à laquelle les gens y sont réellement confrontés.

Espace libre8/10

Le peu de bons outils qui existent pour y remédier aujourd'hui.

D'autres problèmes qui méritent d'être résolus