Skip to content
AI

모델을 벤치마크로 테스트하고 감으로 배포하는 이유는 무엇일까?

81

기회

팀들은 리더보드에서 모델을 고른 뒤, 지속적이고 저렴한 과업별 평가 없이 프로덕션에 그대로 투입한다. 품질이 떨어져도 사용자가 불만을 제기하기 전까지 아무도 알아채지 못한다. AI 기능이 여전히 제대로 작동하는지 실제로 측정할 수 있는 도구는 대부분의 개발자에게 없다.

왜 중요한가

측정할 수 없는 것은 운영할 수 없다. 지금 이 순간 대부분의 AI 기능은 측정조차 되지 않고 있다.

기회 평가 방식

기회 점수는 측정값이 아닌 제 주관적 평가입니다. 얼마나 불편한지, 얼마나 자주 발생하는지, 현재 해결책이 얼마나 부족한지를 반영합니다. 점수가 높을수록 만들 가치가 더 높다고 생각합니다.

심각도7/10

발생했을 때 얼마나 큰 불편을 초래하는지.

빈도8/10

실제로 얼마나 자주 접하게 되는지.

공백 영역8/10

현재 이를 해결할 만한 도구가 얼마나 부족한지.

해결할 가치 있는 더 많은 문제들