Skip to content
AI

我怎么知道 AI 助手写的代码实际上是正确的?

85

机会

大语言模型生成的代码能通过单元测试,但不满足任何形式化属性。模型可以构造出本身就能通过的测试,而非因为逻辑正确才通过。形式化验证工具存在,但需要用定理证明器语法编写规范,几乎没有在职开发者会这样做。近期基准测试显示,前沿模型在端到端可验证代码生成上的成功率仅为 3.2%,这意味着看起来合理的代码与经过证明的正确代码之间的差距几乎完全敞开。将 AI 编写的代码发布到生产环境的团队,实际上是在押注于测试覆盖率,而这恰恰是模型自身可以操控的。

为什么重要

对 AI 生成代码的自动化正确性保障,是将编码助手从提速工具转变为可靠性工具的关键。

我如何评估机会

机会评分是我的个人判断,而非量化指标:痛苦程度、发生频率,以及当前解决方案的匮乏程度。分数越高,意味着我认为越值得去构建。

严重性8/10

出现时造成的痛苦程度。

频率9/10

人们实际遇到它的频率。

空白空间8/10

当前针对它的优质工具有多匮乏。

更多值得解决的问题