当AI开始给AI做代码评审:代理自进化的真实路线图

AI PM 编辑部 · 2026年06月28日 · 126 阅读 · AI/人工智能

正在加载视频...

视频章节

大多数AI Agent失败,不是因为模型不够强,而是因为没人知道如何“持续改进”它们。Nearform 技术负责人 Alfonso Graziano 给出了一条反直觉的答案:让 AI 自己来优化 AI。结果很残酷也很惊人——18% 到 83%,只用了 10 轮迭代。

当AI开始给AI做代码评审:代理自进化的真实路线图

大多数AI Agent失败,不是因为模型不够强,而是因为没人知道如何“持续改进”它们。Nearform 技术负责人 Alfonso Graziano 给出了一条反直觉的答案:让 AI 自己来优化 AI。结果很残酷也很惊人——18% 到 83%,只用了 10 轮迭代。

所有人都在要 Agent,但没人愿意付出它的真实成本

现在的行业有点魔幻:每个团队都想要 AI Agent,自动化工作流、企业搜索、客服、研发助理——听起来无所不能。但 Alfonso Graziano 一上来就泼冷水:Agent 的问题不是“做不到”,而是“太贵、太慢、太不稳定”。

幻觉、非确定性、延迟、Token 成本,这些不是边角料,而是 Agent 的日常。更糟的是,很多团队一边抱怨 Agent 不靠谱,一边还在用“改 prompt + 祈祷”的方式调系统。Alfonso 的核心判断很直接:AI Agent 本质上就是软件,而软件需要工程化的方法来迭代,否则一定会崩。

于是,一个听起来有点疯狂的思路出现了——既然 AI 已经很擅长写代码,那为什么不让 AI 来“修 AI”?

把 Agent 当成“可测试的软件”,Golden Dataset 才是分水岭

在 Alfonso 的方法论里,最关键的不是模型,而是评估体系。他反复强调一个概念:Golden Dataset。

它不是普通测试用例,而是由领域专家共同定义的“期望行为集合”:给定输入,Agent 应该调用哪些工具、如何串联、输出什么样的结果。你可以把它理解成一个为非确定性系统量身定制的测试套件。

当他们用一个极简的 Hello World Agent 跑 eval 时,结果非常残酷:通过率只有 18%。原因并不神秘——没有工具、没有上下文、prompt 也不完整。这个数字的意义在于,它给了团队一个冷冰冰的现实基线:不做工程化,Agent 只是在“蒙对”。

更重要的是,Golden Dataset 不是一次性资产。每次修复 bug、发现新失败模式,都会被反向写入数据集,防止未来回归。这一步,决定了 Agent 是玩具,还是系统。

真正的转折点:让 Agent 自己提出假设、改代码、跑评估

灵感来自 Andrej Karpathy 的 Auto Research,Alfonso 构建了一个叫 AutoAgent 的系统,专门用来“优化其他 Agent”。

流程听起来很像一支不知疲倦的工程团队:定义优化目标(用 Markdown 写清楚)、跑 eval 拿到基线、每一轮新建分支、提出假设、修改代码或 system prompt、重新评估,如果指标变好就合并,否则回滚。

结果呢?一个原本只有 18% 准确率的 naive Agent,在大约 10 轮迭代后直接拉到 83%。更有说服力的是,在已经由人类工程师深度优化过的生产级 Agent 上,AutoAgent 仍然能挤出大约 10% 的提升。

这里用到的并不是什么黑魔法,而是像 Claude Code 这样的 coding agent,读取 eval 报告、trace、失败样本,在人类设定的约束内持续尝试。关键不在“全自动”,而在“可审计、可回滚、有记录”。

Eval 只能救一半,真正的敌人藏在真实用户里

Alfonso 很清醒:再好的 eval,也覆盖不了真实世界。第二类大坑,来自 live data。

他们在生产环境里系统性地收集 trace、用户反馈、工具调用路径、延迟和 Token 使用情况,然后做聚类和根因分析。哪些失败是偶发?哪些是系统性缺陷?哪些其实是需求不清?

确认的问题会被转化为修复提案,由 coding agent 实现;被验证过的失败模式,则会反向写入 Golden Dataset,变成“以后绝不能再犯”的测试用例。这形成了一个闭环:线上失败 → 分析 → 修复 → 固化为评估。

支撑这一切的,是 Alfonso 所说的 Harness Engineering:spec-driven development、质量门禁(lint、eval)、上下文工程和可观测性。没有 observability,Agent 在生产里做了什么,你根本无从得知。

总结

这场分享最反直觉的地方在于:Agent 的未来,不在更大的模型,而在更严肃的工程。把 Agent 当“会思考的软件”,用 Golden Dataset 管住行为,用 AutoAgent 放大迭代速度,用 live data 校准现实偏差。

如果你正在做 AI Agent,真正可执行的第一步不是换模型,而是问自己三个问题:我有没有稳定的评估基线?失败能不能被复现?改动能不能被回滚?

当 AI 开始给 AI 做代码评审时,拼的已经不是想象力,而是谁更懂工程纪律。


关键词: AI Agent, Golden Dataset, AutoAgent, 提示工程, 可观测性

事实核查备注: 需要核查的事实包括:Alfonso Graziano 的身份与 Nearform 关系;O'Reilly 图书《Learning AI Native Software Engineering》;Andrej Karpathy 的 Auto Research 项目;准确率从 18% 提升到 83%、67% 提升到 86% 的具体实验背景;Claude Code 在 AutoAgent 中的角色描述。