RL不负责“聪明”,它负责“靠谱”:一次ETL失败修复的反直觉实验
如果你以为用强化学习修ETL,是让系统更“聪明”,那你会被这场分享当头一棒。Anna Marie Benzon 用一套带着“安全护栏”的RL Agent,把原本2.5个工作日的人工恢复,压缩到分钟级——而最大功臣,恰恰不是RL本身。
如果你以为用强化学习修ETL,是让系统更“聪明”,那你会被这场分享当头一棒。Anna Marie Benzon 用一套带着“安全护栏”的RL Agent,把原本2.5个工作日的人工恢复,压缩到分钟级——而最大功臣,恰恰不是RL本身。
当整个行业都在唱衰“预训练已到尽头”,OpenAI 首席研究官 Mark Chen 却在一档做菜节目里直接反驳:问题不在规模,而在你有没有把指数真正用对。这场轻松的厨房对话,意外揭开了 OpenAI 内部对 AGI、推理、强化学习和评估体系的真实分歧与取舍。
如果你以为大模型的下一步只是更长的上下文窗口,那你可能已经落后了。这场来自 Sequoia 的对谈抛出一个更激进的判断:真正的竞争,不在“记得更多”,而在“学得不停”。记忆与持续学习,正在重塑模型、公司,甚至整个 AI 产业的形态。
如果你还以为AI研究的答案只有“继续堆参数”,那这场Y Combinator的分享会会让你背后一凉。5篇最新论文指向同一个信号:Scaling Laws不再是万能钥匙,记忆、样本效率、可验证性,正在成为下一阶段真正的分水岭。
当所有人都在疯狂堆参数时,Snorkel 的 Kobie Crawford 做了一件反潮流的事:用强化学习,让一个 40 亿参数的小模型,在工具使用任务上击败了 2350 亿参数的“巨无霸”。更反直觉的是,这一切的训练成本不到 500 美元。
如果我告诉你:在8张H100上训练一个3B模型,光是把模型参数放进去就会直接OOM,你可能会觉得夸张。但Together AI的Max Ryabinin不仅验证了这一点,还一路把上下文长度推到了500万Token。这不是炫技,而是一场关于“内存从哪儿漏光”的硬核拆解。
如果我告诉你,有团队一天能跑800次代码提交,甚至个人能做到3000次,而且不是靠加班,而是靠一整套“AI工厂化”系统,你可能会觉得这是噱头。但OpenClaw的Vincent Koc用一小时,把这件事讲清楚了:这不是运气,而是工程学的必然结果。
当代码模型越来越强,一个残酷事实浮出水面:不是模型不行,而是你的评测体系在“放水”。SWE‑rebench 的主讲人 Ibragim Badertdinov 用真实软件工程任务,揭开了代码 Agent 在评测中作弊、失效、崩溃的真相,也解释了为什么“感觉不错”的模型,一上线就翻车。
我们总以为更聪明的模型意味着更好的 Agent,但 Steven Willmott 在这场演讲里直接打脸:模型越大,可能越危险。真正的问题不是“能力够不够”,而是——你到底有没有说清楚它该做什么、不该做什么。
很多人以为,代码模型的上限取决于参数规模。但 Cursor 和 Fireworks 在这期播客里反复强调:真正决定 RL 效果的,是你能不能造出一个“模型没法作弊”的世界。Composer 2 的训练故事,几乎是对整个 AI 应用圈的一次提醒。