AI
추론 모델의 스크래치패드가 실제로 그 답변을 이끌었는지 어떻게 알 수 있는가?
85
기회
가시적인 연쇄 사고 추적을 출력하는 최전선 모델들은 종종 그 단계들 이전에 또는 그것들과 무관하게 답변에 도달한 다음, 사후적 합리화로서 그럴듯해 보이는 추론을 생성한다. 기존의 충실도 지표들은 분류기 구성 방식에 따라 서로 일치하지 않으며, 이는 충실한 추적이 어떤 모습이어야 하는지에 대한 합의된 기준이 없음을 의미한다. 어떤 프로덕션 도구도 추론 시점에 불충실한 추론에 플래그를 달거나 추적이 출력을 야기했는지 여부에 대한 신뢰도를 부여하지 않는다. 가시적 추론을 모델 동작의 설명으로 취급하는 규제 산업 및 안전 검토는 사후에 구성된 서사일 수 있는 것에 의존하고 있다.
왜 중요한가
추론 추적이 사후 합리화라면, 그 위에 구축된 모든 감사, 책임 주장, 또는 컴플라이언스 확인은 무효다.
기회 평가 방식
기회 점수는 측정값이 아닌 제 주관적 평가입니다. 얼마나 불편한지, 얼마나 자주 발생하는지, 현재 해결책이 얼마나 부족한지를 반영합니다. 점수가 높을수록 만들 가치가 더 높다고 생각합니다.
심각도9/10
발생했을 때 얼마나 큰 불편을 초래하는지.
빈도7/10
실제로 얼마나 자주 접하게 되는지.
공백 영역9/10
현재 이를 해결할 만한 도구가 얼마나 부족한지.