她说别再迷信前沿模型:把推理搬到本地,成本和延迟都没了
如果我告诉你:继续无脑用最强的前沿模型,可能是当前 AI 工程里最昂贵、也最懒惰的选择,你会不会停下来想一秒?在这场分享里,Arize 的 RL Nabors 给出了一个极具冲击力的答案:真正聪明的团队,已经在用本地模型,把推理成本、延迟和安全问题一次性解决。
如果我告诉你:继续无脑用最强的前沿模型,可能是当前 AI 工程里最昂贵、也最懒惰的选择,你会不会停下来想一秒?在这场分享里,Arize 的 RL Nabors 给出了一个极具冲击力的答案:真正聪明的团队,已经在用本地模型,把推理成本、延迟和安全问题一次性解决。
当所有人都在卷模型、卷参数时,Meta 的一线工程负责人却抛出一个反直觉判断:AI 代理真正的瓶颈不是“聪不聪明”,而是“靠不靠谱”。更危险的是,很多 AI 故障并不是模型犯错,而是基础设施把小错放大成事故。
你以为 AI Agent 失败是模型推理不够强?Sonam Pankaj 在这场演讲里给出一个更残酷的答案:大多数 Agent 其实死在了“检索之后”。评估信号进了 dashboard,却从没回到系统里,Agent 注定一错再错。
如果你还在用排行榜和标准Benchmark判断模型强不强,Noam Brown会告诉你:你可能已经被误导了。在这期对话里,他抛出了一个让整个行业不安的观点——不是模型到头了,而是我们的评测方式,已经跟不上AI真实能力的增长。
如果你觉得今天的 AI Agent 已经很强了,Raymond Weitekamp 会当面泼你一盆冷水:它们不是不聪明,而是被我们“管理坏了”。在这场关于 Recursive Coding Agents 的演讲里,他展示了一种正在悄悄改变推理、编程和智能体设计的新范式。
如果你以为大模型的下一步只是更长的上下文窗口,那你可能已经落后了。这场来自 Sequoia 的对谈抛出一个更激进的判断:真正的竞争,不在“记得更多”,而在“学得不停”。记忆与持续学习,正在重塑模型、公司,甚至整个 AI 产业的形态。
当大多数人还在讨论“AI会不会取代人类工作”时,Cloudflare CEO已经给出一个更激进的判断:未来互联网上,AI代理的数量将是人类的1000倍。这不是科幻畅想,而是他刚刚在真实流量数据中看到的拐点。
如果我告诉你:在8张H100上训练一个3B模型,光是把模型参数放进去就会直接OOM,你可能会觉得夸张。但Together AI的Max Ryabinin不仅验证了这一点,还一路把上下文长度推到了500万Token。这不是炫技,而是一场关于“内存从哪儿漏光”的硬核拆解。
如果我告诉你,一个可用的 LLM 推理 API,从零到上线,不到 5 分钟,你大概会以为这是营销话术。但在这场来自 RunPod 的现场演示里,这件事真的发生了。更重要的不是“快”,而是它背后暴露的一个行业转向:AI 开发者,正在彻底告别基础设施焦虑。
如果你还以为视频模型的突破来自更强的视觉网络,这期访谈会直接颠覆你。xAI 团队罕见披露:视频智能的核心进展,其实主要来自大语言模型本身。从 Grok Imagine 的极速落地,到 VideoGen 与 World Model 的分野,这是一场只有一线从业者才会说出口的内部复盘。