Skip to content
AI x Crypto

如何在不披露数据集的情况下证明模型是基于已获授权的数据训练的?

81

机会

去中心化 AI 网络允许任何人贡献算力或数据来训练共享模型,但目前没有任何机制能让下游用户或监管机构在不要求网络披露训练内容的前提下,验证训练语料库排除了被污染、被盗取或未经授权的数据。当前的数据溯源要么依靠贡献者自行签署的声明清单,要么依靠与去中心化目的相悖的中心化审计。2025 年 2 月一篇关于激活反转攻击的论文表明,联邦训练期间交换的梯度信号可被用于部分重建训练数据,这意味着任何需要共享梯度的溯源方案同样会泄露数据。2025 年 OWASP LLM 十大风险明确将供应链数据投毒列为一个类别,但针对开放式去中心化训练的标准化缓解措施尚不存在。

为什么重要

在缺乏可验证数据溯源的情况下,任何在公共去中心化网络上训练的模型,对于面临监管或版权审查的下游应用而言,都是一项潜在责任。

我如何评估机会

机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。

严重性8/10

出现时造成的痛苦程度。

频率7/10

人们实际遇到它的频率。

空白空间9/10

当前针对它的优质工具有多匮乏。

更多值得解决的问题