Skip to content
AI

为什么在当今互联网上训练的模型会随着AI生成内容的增多而逐渐变差?

82

机会

互联网现已成为前沿模型的主要训练语料库,并已充斥着没有任何已部署过滤器能够可靠识别的AI生成文本。2024年至2026年间发表的研究表明,训练过程中即使是千分之几的合成数据也会在连续世代中触发分布崩溃,导致输出多样性收窄,尾部性能下降。这一反馈循环具有结构性:今年训练的模型产生的内容会污染明年训练运行的语料库。所提出的缓解措施,如来源级白名单、水印过滤器和合成数据验证器,各自都有绕过途径,且均未在网络爬虫规模上部署。目前尚无公认的协议来识别和隔离AI生成的训练数据,以防其进入模型。

为什么重要

不断退化的共享训练语料库为所有基于公共数据构建的模型设定了上限,且这一上限随着每一代模型的迭代而不断降低。

我如何评估机会

机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。

严重性8/10

出现时造成的痛苦程度。

频率8/10

人们实际遇到它的频率。

空白空间8/10

当前针对它的优质工具有多匮乏。

更多值得解决的问题