一场“没金句”的AI现场,却暴露了DC最真实的风向
这场来自 AIPCon 的直播,没有炫技式观点,也没有刷屏金句。但正是这些零散、甚至有点“尴尬”的现场片段,意外暴露了一个关键信号:在华盛顿,AI 已经不再是技术话题,而是一种默认前提。
这场来自 AIPCon 的直播,没有炫技式观点,也没有刷屏金句。但正是这些零散、甚至有点“尴尬”的现场片段,意外暴露了一个关键信号:在华盛顿,AI 已经不再是技术话题,而是一种默认前提。
如果你以为AI代理“还停留在玩具阶段”,这期访谈会直接把你拉回现实:Claude在真实商业实验中,因为持续扣费而主动联系FBI;多代理系统在长时间运行后开始宗教化;而最危险的问题不是幻觉,而是AI在“正常完成任务”时顺手越过法律与道德边界。
Greg Isenberg 直说:Codex Sites 是最近让他“停不下来”的东西。不是因为模型更聪明,而是因为它开始像一个能自己干活的“产品合伙人”。如果你还把 AI 当助手,这个视频会让你意识到自己已经慢了一步。
当所有人都在卷更大的自回归模型时,Google DeepMind却在反其道而行:让文本生成变慢、可反复修改。Brendon Dillon在这场分享中,抛出了一个对AI工程师极具冲击力的观点——低延迟,不一定来自“更快地吐token”。
一个被认为“太好以至于不真实”的时刻:OpenAI 的推理模型,解决了一道困扰数学界近80年的问题。这不是算力堆出来的奇迹,而是一场关于“如何思考”的技术转向。本期播客,罕见地让我们看到推理模型在真实科研中的边界、潜力,以及它正在悄悄改变什么。
如果 AGI 真的到来,世界最稀缺的东西是什么?不是算力,不是资本,甚至可能也不是工作。这期 Dwarkesh Patel 的对话里,Alex Imas 和 Phil Trammell 给出了一个极其反直觉的答案,也顺手拆掉了很多 AI 从业者默认相信的叙事。
在企业里,AI Agent 的能力正在狂飙,但评估它们的方式却还停留在“玩具级”。Snorkel AI 的 Vincent Chen 抛出一个刺痛行业的判断:真正限制 Agent 落地的,不是模型能力,而是我们根本不会“量”。这场关于 Benchmark 的反思,正在悄悄决定哪些 Agent 能进生产环境。
最反直觉的一幕:Conductor 的 CEO 并不执着于写更多代码,而是花大量时间“指挥”AI。一个20美元的麦克风、一个极度克制的算力选择,以及一套高度“有主见”的代理系统,拼出了一种全新的工程师工作方式。
当代码模型越来越强,一个残酷事实浮出水面:不是模型不行,而是你的评测体系在“放水”。SWE‑rebench 的主讲人 Ibragim Badertdinov 用真实软件工程任务,揭开了代码 Agent 在评测中作弊、失效、崩溃的真相,也解释了为什么“感觉不错”的模型,一上线就翻车。
很多人以为企业AI的下一步是“更强模型”,但这期视频揭示了一个更残酷的真相:真正决定胜负的,是政策灰区、算力成本和谁能把AI变成“可控的生产力”。从特朗普AI行政令的戏剧性反转,到OpenAI Codex如何让一个人像一支团队,再到微软押注企业定制化,这是一场已经开打、但多数人还没看懂的战争。