OpenAI首席研究官边做菜边摊牌:预训练没死,推理才刚开始

AI PM 编辑部 · 2026年06月25日 · 107 阅读 · AI/人工智能

正在加载视频...

视频章节

当整个行业都在唱衰“预训练已到尽头”,OpenAI 首席研究官 Mark Chen 却在一档做菜节目里直接反驳:问题不在规模,而在你有没有把指数真正用对。这场轻松的厨房对话,意外揭开了 OpenAI 内部对 AGI、推理、强化学习和评估体系的真实分歧与取舍。

OpenAI首席研究官边做菜边摊牌:预训练没死,推理才刚开始

当整个行业都在唱衰“预训练已到尽头”,OpenAI 首席研究官 Mark Chen 却在一档做菜节目里直接反驳:问题不在规模,而在你有没有把指数真正用对。这场轻松的厨房对话,意外揭开了 OpenAI 内部对 AGI、推理、强化学习和评估体系的真实分歧与取舍。

在厨房里聊 AGI:最反直觉的一句话先说了

这期视频最“炸”的点,并不是某个技术细节,而是一句态度鲜明的判断。

当主持人聊到行业里流行的“pre-training is dead(预训练已死)”叙事时,Mark Chen 几乎是直接反击。他的原话大意是:他坚定相信 scaling laws,而且是“指数之上的指数”。这不是修辞,而是方向判断。

在很多公司转向只谈后训练、对齐和应用的时候,OpenAI 内部并没有把预训练视为一个已经结束的时代。相反,Chen 提到,很多人误解了瓶颈的来源——不是数据或参数规模不再有用,而是我们还没完全释放推理能力的潜力。

这也解释了为什么 OpenAI 在内部花了“大量的 steering”,才让整个公司真正押注到 reasoning 这件事上。推理不是一个小 feature,而是一次路线级别的转向:模型不只是更大,而是更会“想”。

没有 PhD 也能做研究?他给的路径异常朴素

视频中一个很容易被忽略、但对年轻研究者极其重要的观点是:PhD 没那么重要。

当被问到“如果没有博士学位,怎么进入前沿研究”时,Chen 的回答非常务实——去复现你真正敬佩的论文。不是读懂摘要,而是完整复现。

他举了一个经典例子:AlphaGo 对李世石的第 37 手。很多人被那一步震撼,但真正拉开差距的,是有没有人回到最底层问一句:我能不能把一个 DQN 跑通?

这里隐含的研究观很清晰:研究不是身份,而是一种能力结构。你是否能从一个模糊的想法出发,把它拆解、实现、验证?这和他早年提到的“交易员经验”形成了呼应——交易和研究一样,极度依赖细节敏感度,而这种技能是可迁移的。

强化学习的尴尬现实:不是什么都适合 RL

作为曾经被寄予厚望的范式,强化学习在这次对话里被放在了一个更冷静的位置。

Chen 直言,RL 在“主观性强”的领域一直有 headwinds。原因很简单:当对错难以定义时,reward 就很难定义。而一旦 reward 不稳定,整个系统就会变得不可控。

相比之下,数学和计算机科学这种“要么对、要么错”的领域,反而是 RL 更容易发挥威力的地方。你实现对了没有,是可以被严格判定的。

这其实也间接解释了为什么我们现在看到的很多“move 37”时刻,更多出现在形式化程度高的领域,而不是纯创意或审美驱动的任务中。

真正的难题不是变强,而是如何评估“超人智能”

当模型能力逼近甚至超过人类时,评估本身开始崩塌。

Chen 提到一个行业里越来越明显的问题:benchmarking 现象正在失效。模型开始“学会”基准,而不是学会能力。这直接引出了他口中的“evals crisis”。

OpenAI 的应对方式有两个关键信号:第一,开始更多地与外部组织合作做评估;第二,刻意把 eval 团队与优化模型的团队分离。

这种组织结构上的隔离,本质上是在对抗 Goodhart 定律——当一个指标成为目标,它就不再是好指标。尤其是在评估可能具备超人能力的系统时,任何和训练目标过度耦合的指标,都会失真。

研究管理的潜规则:算力怎么分,比方向更重要

比技术更少被公开讨论的,是研究资源如何分配。

Chen 提到,高层研究 roadmap 应该相对稳定,但在执行层面,算力分配是最强的“方向盘”。什么项目能拿到 compute,往往比 PPT 上写了什么更能决定结果。

他也区分了不同类型的研究者:有的人擅长 low-hanging fruit,有的人适合 moonshot。两者都重要,但评价标准不能混用。

一个失败的研究赌注,并不一定是负价值。关键在于,它是否基于合理的期望值。这种 expectation-based value 的视角,透露出 OpenAI 内部对失败的容忍度,也解释了为什么他们敢在长上下文、压缩(compaction)等方向上持续下注。

总结

这场“边做汤边聊 AGI”的对话,真正的价值不在某个结论,而在一整套研究世界观:预训练并未终结,推理才是放大器;评估正在成为新的瓶颈;而研究能力,与头衔关系不大。

对从业者来说,最现实的 takeaway 是:不要被流行叙事牵着走。与其追逐“下一波风口”,不如扎实复现一篇你真正佩服的工作;与其纠结模型是不是又大了一点,不如思考它是否真的更会推理。

如果未来几年 AGI 的竞争真的取决于谁更会“想清楚问题”,那今天你训练的,不只是模型,还有你自己的研究品味。


关键词: OpenAI, AI推理, 预训练, 强化学习, AGI

事实核查备注: 需要核查:1)Mark Chen 的正式头衔是否为 OpenAI 首席研究官;2)视频发布时间是否为 2026-06-25;3)关于“pre-training is dead”与 scaling laws 的表述是否为原意转述;4)eval 团队与优化团队分离是否为视频中的明确描述。