Skip to content
AI

내가 파인튜닝하고 있는 오픈 가중치 기반 모델이 오염되지 않았음을 어떻게 알 수 있는가?

83

기회

사전 학습된 모델 가중치에 심어진 백도어는 전체 파라미터 파인튜닝, 어댑터 학습, RLHF 업데이트를 거쳐도 지속되는데, 이는 트리거 패턴이 목적 전환 및 부분 동결 전략에서도 살아남기 때문이다. 이러한 트리거는 표준적인 행동 안전성 테스트와 벤치마크 평가로는 탐지되지 않는다. 이를 탐지하려면 화이트박스 가중치 분석이 필요하지만 일반적인 파인튜닝 실무자는 이를 실행하지 않으며, 주요 모델 허브들도 체크포인트를 공개적으로 다운로드 가능하게 하기 전에 의무적인 스캐닝을 적용하지 않는다. 손상된 기반 모델 위에 프로덕션 시스템을 구축하는 조직은 배포 환경에서 트리거가 발동할 때까지 아무런 이상 신호도 받지 못한다.

왜 중요한가

오픈 가중치 파인튜닝 공급망에는 보안 관문이 없으며, 실패 방식은 모든 표준 검사를 통과하는 백도어다.

기회 평가 방식

기회 점수는 측정값이 아닌 제 주관적 평가입니다. 얼마나 불편한지, 얼마나 자주 발생하는지, 현재 해결책이 얼마나 부족한지를 반영합니다. 점수가 높을수록 만들 가치가 더 높다고 생각합니다.

심각도9/10

발생했을 때 얼마나 큰 불편을 초래하는지.

빈도7/10

실제로 얼마나 자주 접하게 되는지.

공백 영역8/10

현재 이를 해결할 만한 도구가 얼마나 부족한지.

해결할 가치 있는 더 많은 문제들