Skip to content
AI

为什么我们用基准测试来评估模型,却凭感觉把它们部署上线?

81

机会

团队从排行榜上挑选模型,然后在生产环境中运行,几乎没有任何持续、低成本、针对特定任务的评估。当质量出现偏差时,没有人会察觉,直到用户投诉才发现。对大多数开发者而言,真正用于衡量 AI 功能是否仍然有效的工具根本不存在。

为什么重要

无法衡量的东西就无法有效运营,而当下大多数 AI 功能都缺乏有效的度量。

我如何评估机会

机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。

严重性7/10

出现时造成的痛苦程度。

频率8/10

人们实际遇到它的频率。

空白空间8/10

当前针对它的优质工具有多匮乏。

更多值得解决的问题