Skip to content
AI

我如何判断自己正在微调的开放权重基础模型没有被投毒?

83

机会

植入预训练模型权重的后门在全参数微调、适配器训练和RLHF更新后依然存在,因为触发模式能够在目标偏移和部分冻结策略下存活。这些触发器对标准行为安全测试和基准评估不可见。检测它们需要进行白盒权重分析,而普通微调从业者从不执行此类分析,主要模型平台在检查点公开下载前也不进行强制扫描。在受损基础模型上构建生产系统的组织,在触发器于部署中触发之前,根本不会收到任何异常信号。

为什么重要

开放权重微调供应链没有安全门控,其失效模式是一个能够通过所有标准检查的后门。

我如何评估机会

机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。

严重性9/10

出现时造成的痛苦程度。

频率7/10

人们实际遇到它的频率。

空白空间8/10

当前针对它的优质工具有多匮乏。

更多值得解决的问题