她在 OpenAI 学到最重要的一课:永远不要低估模型

AI PM 编辑部 · 2026年06月16日 · 119 阅读 · AI/人工智能

正在加载视频...

视频章节

如果你还在用老 benchmark 判断模型能力,Tejal Patwardhan 会直说一句:那几乎已经失效了。这一期 OpenAI 官方播客里,她讲了为什么“BenchMaxxing 是坏事”、为什么 o1 让人第一次有了“AGI 的体感”,以及评测本身,正在成为 AI 时代最难、也最被低估的工程。

她在 OpenAI 学到最重要的一课:永远不要低估模型

如果你还在用老 benchmark 判断模型能力,Tejal Patwardhan 会直说一句:那几乎已经失效了。这一期 OpenAI 官方播客里,她讲了为什么“BenchMaxxing 是坏事”、为什么 o1 让人第一次有了“AGI 的体感”,以及评测本身,正在成为 AI 时代最难、也最被低估的工程。

“Benchmarking is bad”:一句话把全行业骂醒

节目一开场,Tejal Patwardhan 就抛出了一句极具杀伤力的话:“Generally bad. Benchmarking is bad.” 如果你在 AI 圈,这句话足以让人愣住。毕竟,过去十年,模型进步几乎就是靠 benchmark 排行榜来“宣布胜利”。

她的意思并不是“不要评测”,而是:当 benchmark 被刷爆、被记住、被过拟合,它就不再告诉你任何关于真实能力的东西。这就是她反复提到的“benchmark saturation”——模型已经接近满分,但现实世界的问题却远没那么干净。

更糟的是所谓的 BenchMaxxing:为了榜单优化模型,而不是为了人类真实工作场景优化模型。Tejal 的问题始终只有一个:“这些模型,到底能不能在真实工作中帮到人?”如果不能,那再漂亮的分数,也只是自嗨。

她不是“跳槽进 OpenAI”,而是“在这里长大”

当 Andrew Mayne 想按惯例聊履历时,Tejal 明显有点抗拒。她给出的回答很有意思:“I grew up at OpenAI.”

她是在 2023 年秋天加入 OpenAI 的——就在 ChatGPT 爆火、GPT-4 发布、Superalignment 团队刚刚成立之后。她加入的是 Preparedness 团队,核心任务只有一个:搞清楚我们到底造出了多强的东西,以及这意味着什么风险

这是一个极其特殊的时间点。模型能力在肉眼可见地跃迁,但人类对它们的理解却严重滞后。Tejal 说,那是一种既兴奋又紧张的状态:你一边看到能力暴涨,一边又发现,旧的衡量方式正在快速失效。

从“能力溢出”到“不要低估模型”

Tejal 特别提到一个词:capability overhang(能力溢出)。意思是:模型已经具备某种能力,但我们还没有意识到,或者还没设计出能触发它的评测方式

这也是她后来反复强调“不要低估模型”的原因。在多个 frontier eval 中,他们一开始设定了“人类基线”,而且是相当专业、相当难的那种。团队内部其实非常紧张——模型真的能超过吗?

结果往往是:能,而且超过得很快。无论是推理能力,还是在专业任务中的表现,“更聪明的模型,是真的更聪明”。这直接改变了她对进展速度的判断:所谓“撞墙”,很多时候只是人类的想象力先撞墙了。

o1:第一次有了“AGI 的体感”

聊到 o1,Tejal 的措辞明显变了。她形容 o1 的发布过程“非常刺激”,甚至用了一个耐人寻味的说法:“it broke out of the sandbox”。

这不是指某个具体 benchmark,而是一种整体感受:模型开始在多个维度上表现出超出预期的泛化能力,让人第一次有了“这东西不只是完成任务,而是在解决问题”的直觉。

她甚至说,那是一个“feel the AGI moment”。不是因为某个正式宣布,而是因为:你开始发现,模型已经被大量真实用户,用在了他们工作中最重要的部分。数学专家在认真讨论模型的推理水平,而不是把它当玩具。

评测的未来:更痛、更慢、更接近现实

那么,未来的 eval 会是什么样?Tejal 给了一个很反常识的答案:“pain is the moat”。

真正有价值的评测,一定是痛苦的:
- 静态题库不够,要面对开放世界
- 单模态不够,多模态直接让复杂度爆炸
- 小规模 demo 不够,必须能在真实规模下跑

她提到,很多 public benchmark 并没有经历真正的“战火”,而像 SWE-bench Verified 这样的评测,才更接近模型在真实工程环境中的表现。这也是为什么,有些评测甚至会为了质量,推迟数周发布。速度不再是第一位,真实性才是

总结

这期播客最重要的启发其实很直接:如果你还只盯着排行榜、分数和单一 benchmark,你很可能正在系统性低估模型能力。对从业者来说,更好的做法是:把模型真正丢进你的工作流,用它解决真实、复杂、带噪声的问题。评测不是为了证明模型“赢了”,而是为了帮我们判断:哪些能力已经出现,哪些风险正在逼近。最后留一个判断题:当 eval 本身变成最难的工程问题时,也许真正的分水岭,已经不远了。


关键词: OpenAI, 模型评测, AGI, o1, Benchmark Saturation

事实核查备注: 需要核查:Tejal Patwardhan 的正式职务头衔;加入 OpenAI 的具体时间(2023 年秋);o1 的公开发布时间与描述;播客中关于 Turing Test 的原话语境。