Skip to content
AI

오픈소스 모델이 생성한 텍스트를 해당 모델로 신뢰할 수 있게 추적할 수 없는 이유는 무엇인가?

84

기회

폐쇄형 모델 제공업체는 추론 시점에 생성된 텍스트에 통계적 워터마크를 삽입할 수 있어, 사후에 특정 모델로 콘텐츠를 귀속시킬 수 있다. 오픈소스 모델은 사용자에게 디코딩 절차에 대한 완전한 접근 권한을 제공하므로, 샘플링 코드 몇 줄만 수정하면 생성 시점의 워터마크를 제거할 수 있다. 이미 생성된 텍스트에 사후적으로 워터마크를 삽입하는 방식은 패러프레이즈 공격에 취약하다. 모델 가중치에 마커를 내장하는 방식은 일부 공격은 견디지만 파인튜닝에는 취약하며, 로컬 가중치를 실행하는 사람이라면 누구나 오후 한 나절 만에 이를 적용할 수 있다. 2025년 말 기준, 오픈 가중치 모델 출력에 대해 실용적이고 제거 불가능한 출처 표시를 제공하는 방식은 존재하지 않으며, 연구 커뮤니티도 이 문제가 여전히 미해결 상태임을 인정하고 있다.

왜 중요한가

오픈 모델에 대한 워터마킹이 없는 한, AI 생성 텍스트의 출처는 생성자가 협력을 선택할 때에만 추적 가능하다.

기회 평가 방식

기회 점수는 측정값이 아닌 제 주관적 평가입니다. 얼마나 불편한지, 얼마나 자주 발생하는지, 현재 해결책이 얼마나 부족한지를 반영합니다. 점수가 높을수록 만들 가치가 더 높다고 생각합니다.

심각도8/10

발생했을 때 얼마나 큰 불편을 초래하는지.

빈도8/10

실제로 얼마나 자주 접하게 되는지.

공백 영역9/10

현재 이를 해결할 만한 도구가 얼마나 부족한지.

해결할 가치 있는 더 많은 문제들