AI
我如何判断自己正在微调的开放权重基础模型没有被投毒?
83
机会
植入预训练模型权重的后门在全参数微调、适配器训练和RLHF更新后依然存在,因为触发模式能够在目标偏移和部分冻结策略下存活。这些触发器对标准行为安全测试和基准评估不可见。检测它们需要进行白盒权重分析,而普通微调从业者从不执行此类分析,主要模型平台在检查点公开下载前也不进行强制扫描。在受损基础模型上构建生产系统的组织,在触发器于部署中触发之前,根本不会收到任何异常信号。
为什么重要
开放权重微调供应链没有安全门控,其失效模式是一个能够通过所有标准检查的后门。
我如何评估机会
机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。
严重性9/10
出现时造成的痛苦程度。
频率7/10
人们实际遇到它的频率。
空白空间8/10
当前针对它的优质工具有多匮乏。