Skip to content
AI

모델 리더보드 점수는 왜 테스트셋이 학습에 사용된 적 없을 때 무너지는가?

82

기회

MMLU 같은 정적 벤치마크는 오염률이 최대 45%에 달하며, 테스트 항목을 패러프레이징하거나 번역한 버전은 정확 일치 기반 오염 제거를 통과하면서도 공개 점수를 부풀립니다. 모델은 오염된 태스크에서 리더보드 상위를 차지했다가, 동일한 태스크를 깔끔하게 다시 표현하면 실패할 수 있습니다. 태스크를 주기적으로 갱신하는 동적 벤치마크가 존재하지만 표준화된 설계 기준이 없어, 벤치마크 간 결과를 비교하거나 측정 대상 능력을 대표하는지 검증할 수 없습니다. 리더보드에 공개된 모든 성능 및 안전성 주장은 어떤 독립 기관도 오염 여부를 검증할 수 없는 수치에 기반하고 있습니다.

왜 중요한가

신뢰할 수 있는 평가는 모든 후속 안전성 및 배포 결정의 전제 조건이지만, 그 결정의 근거가 되는 수치는 현재 신뢰할 수 없는 상태입니다.

기회 평가 방식

기회 점수는 측정값이 아닌 제 주관적 평가입니다. 얼마나 불편한지, 얼마나 자주 발생하는지, 현재 해결책이 얼마나 부족한지를 반영합니다. 점수가 높을수록 만들 가치가 더 높다고 생각합니다.

심각도8/10

발생했을 때 얼마나 큰 불편을 초래하는지.

빈도8/10

실제로 얼마나 자주 접하게 되는지.

공백 영역8/10

현재 이를 해결할 만한 도구가 얼마나 부족한지.

해결할 가치 있는 더 많은 문제들