正在加载视频...
视频章节
如果你还以为AI研究的答案只有“继续堆参数”,那这场Y Combinator的分享会会让你背后一凉。5篇最新论文指向同一个信号:Scaling Laws不再是万能钥匙,记忆、样本效率、可验证性,正在成为下一阶段真正的分水岭。
Y Combinator点名的5篇论文,正在悄悄改写AI研究的主战场
如果你还以为AI研究的答案只有“继续堆参数”,那这场Y Combinator的分享会会让你背后一凉。5篇最新论文指向同一个信号:Scaling Laws不再是万能钥匙,记忆、样本效率、可验证性,正在成为下一阶段真正的分水岭。
第一刀就砍向神话:Scaling Laws 真的还管用吗
这场分享最“炸”的地方,不是某个模型又涨了多少参数,而是有人直接抛出了一个在几年前几乎是“政治不正确”的问题:Scaling Laws 还成立吗?
其中一篇论文从一个极端宏大的视角切入——“自生命在地球出现以来的尺度变化”。这个对比本身就很狠:如果智能真的只是规模的副产品,那为什么生物智能的跃迁如此稀疏?演讲者明确指出,至少在当前研究里,单纯扩大模型规模,已经开始出现边际收益快速下降的迹象。
这不是说 Scaling Laws 失效了,而是它正在变成“必要但不充分条件”。对很多AI从业者来说,这意味着一个残酷现实:你所在的团队如果没有无限算力,可能反而更接近未来。
记忆,成了强化学习的新瓶颈
在强化学习部分,一个高频词被反复提起:memory。
过去我们习惯把环境建模为有限时间的 MDP(finite horizon MDP),假设智能体“看得见的历史”是有限的。但现实世界并不是这样运行的。论文指出,真正复杂的决策问题,本质上是长期依赖问题,而不是奖励函数调一调就能解决。
这也是为什么“记忆”突然成了热词:不是更大的网络,而是如何让模型保留、调用、更新长期经验。演讲者用一句话总结得很到位:没有记忆的智能,只是在重复试错,而不是学习。
对做 RL 的人来说,这是方向性的转变——从‘怎么更快学会一个任务’,转向‘怎么不忘掉已经学会的世界模型’。
样本效率,正在取代参数规模成为新指标
另一篇论文抛出了一个听起来简单、但极具杀伤力的指标:intelligence per sample(每个样本的智能产出)。
这背后的潜台词很清楚:如果一个模型需要海量数据才能表现出一点“智能”,那它距离通用智能还很远。相比之下,人类和动物在极少样本下就能泛化,这本身就是一种尚未被工程化的能力。
演讲最后那句“That's all I got”反而显得意味深长——因为真正难的部分,才刚刚开始。样本效率问题,几乎直接决定了哪些研究路线在未来十年还能跑得下去。
模型会写代码,但它真的‘知道’自己写对了吗
接下来,话题转向了程序正确性。一位演讲者抛出一个非常现实的问题:LLMs 可以写代码,但它们能证明代码是正确的吗?
这背后是一篇关注形式化验证与模型能力边界的论文。当前模型在“看起来像对”的任务上表现惊艳,但一旦涉及数学证明、复杂约束或安全关键系统,就会暴露出本质缺陷。
一句评价很刺耳,但也很真实:模型解决的是‘看起来合理的问题’,而不是‘真的重要的问题’。这对想把AI用于高可靠场景的人,是一次明确的警告。
从刷榜到做事:研究目标正在发生位移
在最后几场分享中,一个共识逐渐浮现:我们正在从 benchmark 驱动,转向 problem 驱动。
有演讲者提到,某些任务在排行榜上看起来已经“被解决了”,但一旦换成现实世界的问题,比如复杂系统控制、长期博弈、或者类 RTS 的规划任务,模型立刻显得力不从心。
这也是为什么有人说,现在的进展是“steady progress”——不再是爆炸式指标提升,而是缓慢但扎实的能力外延。对研究者来说,这可能不性感,但更接近真正的价值创造。
总结
这5篇论文放在一起,传递的信息其实非常一致:AI研究正在告别“单一神话”。规模依然重要,但记忆、样本效率、可验证性,正在成为新的主战场。对从业者而言,最现实的行动建议是:重新审视你正在优化的指标——它们是在刷榜,还是在逼近真实世界的问题?未来几年,后者的溢价只会越来越高。
关键词: AI研究趋势, Scaling Laws, 强化学习, 样本效率, 程序正确性
事实核查备注: 需要核查:视频总时长;5篇论文的具体标题与作者;Luke Bailey、Robert George 的准确身份与论文对应关系;关于 Scaling Laws 和生物智能对比的原始表述。