正在加载视频...
视频章节
几乎所有顶级 AI 实验室,都在押一个看似疯狂的赌注:上下文窗口会大到“接近无限”。但 Dwarkesh Patel 在这期对谈里真正抛出的炸弹是——即便算力继续狂飙,AI 进化的真正瓶颈,可能既不是模型规模,也不是架构本身。
下一代训练范式正在成形:无限上下文、RLVR与被低估的学习瓶颈
几乎所有顶级 AI 实验室,都在押一个看似疯狂的赌注:上下文窗口会大到“接近无限”。但 Dwarkesh Patel 在这期对谈里真正抛出的炸弹是——即便算力继续狂飙,AI 进化的真正瓶颈,可能既不是模型规模,也不是架构本身。
一个几乎所有实验室都在押的赌注:上下文窗口会“大到不像话”
Dwarkesh 一开场就点出了一个耐人寻味的共识:几乎所有前沿实验室,都在默默下注“超大上下文窗口”。如果再给两年时间,模型可能会拥有一种主观感受上的“无限上下文”——不仅能记住你刚才说的话,还能保留长时间、跨任务的状态。
这背后的直觉很简单:如果模型能在 in-context learning 里容纳足够多的经验,它是否就不再那么依赖昂贵、缓慢的参数更新?这也是为什么很多人开始把上下文窗口,视为连接“静态模型”和“持续学习系统”的桥梁。
但问题也随之而来:这真的是通往更强智能的正道,还是一种绕开根本难题的权宜之计?Dwarkesh 的态度明显更谨慎——上下文变大,解决的可能只是“记住更多”,而不是“学得更好”。
为什么 AI 电脑操作学得这么慢?一个被严重低估的原因
相比语言、代码这些领域,AI 在“使用电脑”上的进展慢得反常。Dwarkesh 给出了一个非常反直觉、却极具解释力的答案:问题不在模型,而在训练目标是否“可重复回放”。
在语言建模中,你有几乎无限的、可反复利用的训练信号;在围棋、Dota 这类环境中,你可以自我对弈,生成源源不断的数据。但一旦进入真实世界的电脑操作、办公流程、跨软件协作,训练信号立刻变得稀疏、不可复现。
他说了一句很重的话:“如果一个领域无法构造高度可 replay 的训练目标,模型几乎注定进展缓慢。”这也解释了为什么很多 AI Agent demo 看起来聪明,却始终难以稳定复现。不是模型不行,而是这个世界本身不配合训练。
RLVR 的豪赌:白领任务,真的能泛化到现实世界吗?
当前实验室的另一项重注,是 RLVR(强化学习 + 可验证奖励)。逻辑很诱人:先在大量白领任务上训练 Agent,让它学会计划、执行、纠错,然后再把这些能力迁移到更广泛的现实场景。
但 Dwarkesh 抛出了一个让人不安的问题:从“填表格、写报告”到“理解真实世界”,中间真的只差 scale 吗?现实世界的问题,往往没有明确的奖励函数,也没有标准答案。模型在白领任务中学到的,是技能,还是只是对评测分布的过拟合?
更关键的是,人类的泛化能力,并不是靠一次性吃下所有数据实现的,而是通过长期、渐进、带有遗忘与重组的学习过程。这恰恰是当前训练范式最薄弱的地方。
持续学习的真瓶颈:不是架构,而是梯度更新太“浪费样本”
谈到 continual learning,Dwarkesh 明确表达了一个少见但重要的判断:架构可能并不是根本瓶颈。真正的问题在于——梯度更新极其低效。
人类每天都在学习新东西,但这些学习并不会被“打包”进一次共享的、集中式训练中。而当前的大模型训练,恰恰依赖这种集中更新。这意味着,大量宝贵的在线经验,要么被丢弃,要么成本高到无法利用。
在他看来,sample efficiency 和 continual learning 是同一个硬币的两面。如果每一次更新都需要海量样本,那持续学习就永远只能停留在 PPT 里。
从 OPSD 到“模拟现实”:下一代训练范式的两条岔路
那出路在哪?Dwarkesh 提到了两种方向。
一种是相对务实的:从 loss function 下手。比如 OPSD,被视为改善 sample efficiency 的一种尝试,通过更合理地利用已有数据,让每一次梯度更新“值回票价”。
另一种则极其激进,甚至有点科幻:直接烧掉巨量算力,构建一个“视频游戏版的现实”,让模型在其中学习。如果现实世界的数据不可控,那就干脆自己造一个。
这条路代价惊人,但也许是唯一能系统性解决泛化与持续学习的方案。Dwarkesh 并没有给出答案,但问题已经被摆在桌面上。
总结
如果你是 AI 从业者,这期讨论至少传递了三个关键信号:第一,上下文窗口正在从“工程参数”变成“认知假肢”;第二,许多进展缓慢的领域,并不是模型不行,而是训练信号本身不可复用;第三,未来几年的突破,很可能来自 loss、训练目标和数据生成方式,而不只是更大的模型。
真正值得思考的是:当算力不再是唯一答案时,你押注的是哪一个瓶颈会先被打破?无论你在做模型、Agent 还是应用,这个判断,都会决定你接下来两三年的技术路线。
关键词: 上下文窗口, 持续学习, RLVR, AI Agent, 模型训练
事实核查备注: 需要核查:Dwarkesh Patel 在视频中关于“所有实验室都在押超大上下文窗口”的原话表述;RLVR 的具体定义与使用语境;OPSD 是否被明确作为 sample efficiency 方法提及;关于持续学习瓶颈不在架构的判断是否为其个人观点。