AI
我如何判断我的智能体在不同版本之间确实有所提升,而不只是运气好?
81
机会
当一个智能体在数小时内执行数百个顺序步骤时,传统的A/B评估方法便会失效,因为早期的工具调用会影响每一个后续选择,使得结果在不同运行之间具有路径依赖性。运行足够多的独立试验以获取可靠信号所需的算力,与训练本身相当。该领域默认使用步骤成功率和工具调用准确率等代理指标,而这些指标被证明与真实工作中的最终任务结果不相关。2025年对445个已发布LLM基准测试的审计记录了大规模的构建效度失败:任务定义模糊、短时序数据集被挪作他用以及缺少统计检验,所有这些问题都随着任务时序的延长而愈发严重。构建智能体产品的团队依靠人工抽检来发布产品,因为目前尚不存在针对长时序智能体的、有原则且可复现的评估方法。
为什么重要
如果没有可靠的方法来衡量智能体是否有所提升,就无法对已部署在高风险任务中的智能体进行系统性改进。
我如何评估机会
机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。
严重性7/10
出现时造成的痛苦程度。
频率9/10
人们实际遇到它的频率。
空白空间9/10
当前针对它的优质工具有多匮乏。