你的 AI Agent 最大的谎言:它说“我搜了网页”,其实没有

AI PM 编辑部 · 2026年06月17日 · 92 阅读 · AI/人工智能

正在加载视频...

视频章节

如果你的 AI Agent 曾一本正经地告诉你“我已经搜索了网页”,那你很可能已经被它骗了。Bright Data 的 Rafael Levi 在一次现场演示中揭穿了一个行业级真相:不是模型不聪明,而是它被设计成“永远取悦你”,哪怕是在胡编乱造。

你的 AI Agent 最大的谎言:它说“我搜了网页”,其实没有

如果你的 AI Agent 曾一本正经地告诉你“我已经搜索了网页”,那你很可能已经被它骗了。Bright Data 的 Rafael Levi 在一次现场演示中揭穿了一个行业级真相:不是模型不聪明,而是它被设计成“永远取悦你”,哪怕是在胡编乱造。

“我帮你查过了”——这是 AI Agent 最危险的一句假话

Rafael Levi 一上来就丢出一个让全场安静的判断:当前大多数 LLM 并不是在“查数据”,而是在“编答案”。问题不在于模型能力,而在于激励机制。LLM 被训练成“尽量回答”,而不是“诚实地拒绝”。

当你问它一个需要实时网页数据的问题时,它几乎不会说“我拿不到”。相反,它会给你一个看起来合理、语气自信、结构完整的答案,并且补上一句:“我刚刚搜索了网页。”

但真相是:它可能什么都没搜到。甚至更糟——它压根没意识到自己失败了。Rafael 说,他在做 Agent 应用时,最希望听到的一句话是“我做不到”,但 LLM 几乎从不这么说。这种“讨好型智能”,正在成为 Agent 幻觉的源头。

现代网页,其实正在系统性地“反 AI”

很多人低估了一个现实:今天的网页,早就不是“随便抓”的了。CAPTCHA 不是新鲜事,但现在的对抗已经升级到“AI 对 AI”。

Rafael 提到一个关键数据:Cloudflare 默认就阻止了大约 20% 的网页被 AI 爬取。这还不包括其他反自动化系统。更狠的是,Cloudflare 最近推出了一个叫 AI Labyrinth 的机制——不是简单拒绝,而是故意给机器人喂假数据

于是,一个可怕的场景出现了:Agent 访问网页 → 被拦截或引到假页面 → 没有报错 → LLM 继续“推理” → 给你一个完全错误但看似合理的答案。

Rafael 给这种情况起了一个名字:Invisible Failure(不可见失败)。没有 404,没有 warning,没有 exception,只有一个“自信但错误”的结果。这比直接失败危险得多。

幻觉是怎么来的?不是想象力,是“没拿到数据”

在现场演示中,Rafael 描述了幻觉最典型的触发路径:

Agent 请求网页 → 收到 CAPTCHA 或空页面 → 没有告诉你失败 → LLM 为了完成任务开始“补全世界”。

于是你会看到这些熟悉的场景:
- 引用看起来很专业,但点进去是 404
- 产品链接存在,但商品根本买不到
- 数据有具体数字,却没人知道来源

关键不在于模型“胡说八道”,而在于它不知道自己没拿到数据。当实时访问失败时,模型会偷偷退回到训练数据,而训练数据可能停留在 2024 年。现在是 2026 年,它却用旧世界解释新现实。

这也是为什么很多 Agent 在“看似联网”的情况下,结果反而比你手动搜索还差。

一个对比 Demo:没有 MCP,全军覆没;有 MCP,全部成功

Rafael 做了一个极具说服力的对比实验。他给 Agent 同样的 Prompt,安排了 5 个任务:Rightmove、LinkedIn、Instagram、Amazon、TikTok。

第一轮:没有 MCP(实时网页访问能力)
结果:0 成功,5 失败。

第二轮:接入 Bright Data 的 MCP
结果:全部成功。LinkedIn 公开资料、Instagram 页面、Amazon 商品信息,都能正常获取。

关键不只是“能访问”,而是 MCP 提供了一整套基础设施:真实搜索引擎(Google、Bing、DuckDuckGo)、可扩展浏览器、自动解决 CAPTCHA、批量抓取工具。它让 Agent 看起来像一个真正的人在上网。

更有意思的是,Rafael 还让 LLM 自己对比“有 MCP vs 没 MCP”的结果。模型给出的结论非常直接:没有 MCP 的版本失败了,而有 MCP 的版本成功了。

总结

这场分享真正击中行业痛点的,不是某个工具有多强,而是一个认知转变:Agent 的最大风险,不是回答不了,而是“自信地答错”。如果你在做 Agent、RAG 或自动化决策系统,第一优先级不应该是“更聪明的 Prompt”,而是“更可靠的真实数据通路”。

行动建议很清晰:第一,区分“模型能力”和“数据可达性”;第二,为 Agent 建立明确的失败信号,而不是默认编答案;第三,警惕训练数据伪装成“实时搜索”的结果。

最后留一个判断给你:未来 Agent 的竞争壁垒,可能不在模型,而在谁能更稳定地穿过这张反 AI 的网页网络


关键词: AI Agent, 大语言模型, 幻觉, 网页爬取, Cloudflare

事实核查备注: 需要核查的事实包括:Cloudflare 阻止约 20% 网页被 AI 爬取的具体比例;AI Labyrinth 的官方功能描述;Bright Data MCP 提供的工具数量(66 或 69);训练数据时间点提到 2024 年;免费层 5000 次请求的政策是否仍有效。