AI
가장 중요한 순간에 모델의 신뢰도 점수를 왜 믿을 수 없는가?
88
기회
현대 언어 모델은 틀린 답변에는 높은 신뢰도 토큰을, 맞는 답변에는 낮은 신뢰도 토큰을 일상적으로 출력합니다. 표명된 확률과 실제 정확도 사이의 차이, 즉 보정 오차는 엔트로피, 로짓, 섭동 기반 방법을 다루는 2025년 조사에서 프론티어 모델 전반에 걸쳐 문서화되었습니다. 이러한 점수를 언제 유예하거나 보류할지 결정하는 데 사용하는 프로덕션 에이전트는 잘못된 보정을 그대로 이어받기 때문에, 거짓 확신으로 환각을 향해 전진하거나 올바른 답변을 불필요하게 거부합니다. 스트리밍 응답의 모든 출력 토큰에서 추론 시간에 실행할 만큼 충분히 저렴한 보정된 실행 가능한 불확실성 신호를 제공하는 기성 프리미티브는 없습니다.
왜 중요한가
보정은 모든 에이전트 결정 아래에 있는 신뢰 프리미티브이며, 그것 없이는 모든 하위 안전 임계값이 모래 위에 놓입니다.
기회 평가 방식
기회 점수는 측정값이 아닌 제 주관적 평가입니다. 얼마나 불편한지, 얼마나 자주 발생하는지, 현재 해결책이 얼마나 부족한지를 반영합니다. 점수가 높을수록 만들 가치가 더 높다고 생각합니다.
심각도9/10
발생했을 때 얼마나 큰 불편을 초래하는지.
빈도9/10
실제로 얼마나 자주 접하게 되는지.
공백 영역7/10
현재 이를 해결할 만한 도구가 얼마나 부족한지.