正在加载视频...
视频章节
你以为 AI Agent 失败是模型推理不够强?Sonam Pankaj 在这场演讲里给出一个更残酷的答案:大多数 Agent 其实死在了“检索之后”。评估信号进了 dashboard,却从没回到系统里,Agent 注定一错再错。
85%的AI代理失败不是模型不够强,而是信号死在了检索边界
你以为 AI Agent 失败是模型推理不够强?Sonam Pankaj 在这场演讲里给出一个更残酷的答案:大多数 Agent 其实死在了“检索之后”。评估信号进了 dashboard,却从没回到系统里,Agent 注定一错再错。
最反直觉的真相:Agent 失败,73%不是生成问题
如果你在做 AI Agent,可能已经习惯把失败归因到模型不够大、推理不够强。但 Sonam Pankaj 直接泼了一盆冷水:根据他们的观察,73% 的 Agent pipeline 失败,根本不是 generation,而是 retrieval。
更刺眼的是 Gartner 的数据:85% 的 AI 系统无法真正落地、获得牵引力。问题不在于模型“不会想”,而在于系统“记不住教训”。Agent 一次次在同一个任务上翻车,不是因为它笨,而是因为它从来没有从结果中学到任何东西。
Agent 的致命缺陷:它会推理,但不会复盘
Sonam 对 Agent 的定义很清晰:一个具备推理能力、能调用工具、能与世界交互、能检索记忆的 LLM。但他紧接着指出了一个“系统级缺失”——学习。
今天大多数 Agent 架构,本质上是 ReAct 的延伸:Reason → Act → Observe → 再 Reason。听起来很合理,但少了最关键的一步:从 outcome 中学习。
评估信号去哪了?答案很讽刺:死在 dashboard 里。日志被记录、指标被展示,但没有任何系统把这些失败和成功,转化成下一次检索时的指导信号。Agent 看到了结果,却完全不知道“这次到底哪里做对了、哪里做错了”。
为什么“记忆”救不了 Agent?因为它只存事实,不存教训
很多团队意识到了问题,于是开始加 memory。但 Sonam 的评价非常直接:现在的 memory 设计,本质上是“长期上下文存储”。
它存什么?用户偏好、用户画像、历史对话、个性化信息。但它几乎不回答一个关键问题:这个行为,结果是好还是坏?
换句话说,当前的 memory 是静态事实库,而不是经验系统。它不理解 outcome,自然也无法在下一次检索时做出更好的判断。Agent 记得发生了什么,却不知道值不值得再这么做。
Agent RX:让结果成为检索的第一等公民
为了解决这个问题,Sonam 团队提出了一个新概念:Utility Score,以及围绕它构建的 Agent RX(Agent Runtime Experience)。
核心思想只有一句话:把“结果”变成检索重排序的第一等信号。每一次任务的 outcome,不再只是评估指标,而是直接影响未来 retrieval 的权重。
在这个系统里,memory 不再被当作“事实”,而是被当作“推理经验”。实验结果也相当亮眼:在多个 benchmark 中,整体性能从 66% 提升到 76%;在 agentic task 上,精炼后的 memory 系统达到了 61.3%。
当然,这不是银弹。冷启动、utility 漂移、噪声标签、以及 lambda 这样的超参数问题依然存在。但方向已经非常明确:Agent 的进化,不在更大的模型,而在更聪明的记忆。
总结
这场演讲真正值得 AI 从业者记住的,不是某个新指标或新系统,而是一个系统设计层面的提醒:如果你的 Agent 从不从结果中学习,它迟早会在同一个地方反复摔倒。
对实践者来说,一个立刻可行动的问题是:你的评估信号,是否真的回流到了检索与决策层?如果没有,那么无论你换多强的模型,都只是让一个“健忘的 Agent”跑得更快而已。未来的 Agent 竞争,拼的不是谁推理得更花哨,而是谁真正学会了复盘。
关键词: AI Agent, 检索增强生成, Utility Score, Agent RX, 大语言模型
事实核查备注: 需要核查的关键事实包括:Gartner 提到的“85% AI 失败”数据来源与原始表述;“73% pipeline 失败源于 retrieval”的统计口径;benchmark 中从 66% 提升到 76%、以及 61.3% 的具体任务与评测设置;Agent RX 与 Utility Score 是否为演讲中正式命名概念。