AI
为什么我们用基准测试来评估模型,却凭感觉把它们部署上线?
81
机会
团队从排行榜上挑选模型,然后在生产环境中运行,几乎没有任何持续、低成本、针对特定任务的评估。当质量出现偏差时,没有人会察觉,直到用户投诉才发现。对大多数开发者而言,真正用于衡量 AI 功能是否仍然有效的工具根本不存在。
为什么重要
无法衡量的东西就无法有效运营,而当下大多数 AI 功能都缺乏有效的度量。
我如何评估机会
机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。
严重性7/10
出现时造成的痛苦程度。
频率8/10
人们实际遇到它的频率。
空白空间8/10
当前针对它的优质工具有多匮乏。