为什么今天的AI越强,基准测试反而越不可信了?
如果你还在用排行榜和标准Benchmark判断模型强不强,Noam Brown会告诉你:你可能已经被误导了。在这期对话里,他抛出了一个让整个行业不安的观点——不是模型到头了,而是我们的评测方式,已经跟不上AI真实能力的增长。
如果你还在用排行榜和标准Benchmark判断模型强不强,Noam Brown会告诉你:你可能已经被误导了。在这期对话里,他抛出了一个让整个行业不安的观点——不是模型到头了,而是我们的评测方式,已经跟不上AI真实能力的增长。
多数公司还在Demo里炫耀AI Agent时,OpenGov已经把它塞进了真实的政府ERP系统,而且还规模化跑了起来。更反直觉的是,他们成功的关键,不是更大的模型,而是一整套工程化、可控、可观测的Agent体系。
如果你觉得 AI Agent 又强又蠢,那不是你的错。Victor Savkin 在这次演讲里抛出一个极具杀伤力的比喻:Agent 就像“失忆的天才”。它能推理、会规划,却在关键时刻忘掉自己刚做过什么。这不是模型能力问题,而是我们构建 Agent 的方式出了结构性毛病。
同样用AI,为什么有的公司ROI是别人的三倍?答案不在模型参数,而在谁拥有AI决策权。这期《AI Daily Brief》抛出一个反直觉结论:AI的成败,正在从“技术问题”变成“CEO问题”。
当整个行业都在唱衰“预训练已到尽头”,OpenAI 首席研究官 Mark Chen 却在一档做菜节目里直接反驳:问题不在规模,而在你有没有把指数真正用对。这场轻松的厨房对话,意外揭开了 OpenAI 内部对 AGI、推理、强化学习和评估体系的真实分歧与取舍。
如果你还在把Agent理解成“一个模型+一堆工具”,那你已经落后了。Ishaan Sehgal在这场演讲里抛出一个极具争议的观点:真正定义Agent身份的不是模型,也不是运行环境,而是一条不断生长的Log。这不是概念游戏,而是足以重构Agent基础设施的抽象转移。
如果你觉得今天的 AI Agent 已经很强了,Raymond Weitekamp 会当面泼你一盆冷水:它们不是不聪明,而是被我们“管理坏了”。在这场关于 Recursive Coding Agents 的演讲里,他展示了一种正在悄悄改变推理、编程和智能体设计的新范式。
如果你还在用 benchmark 分数评估 AI Agent,那你已经落后一个时代。来自 Meta 超级智能实验室的 Nishant Gupta 直言:高分模型,正在生产环境里悄悄失控。真正决定生死的,不是准确率,而是系统是否“可靠地完成事情”。这场关于 AI 评估的范式转移,正在重塑整个行业。
当所有人都在焦虑“AI 抢走写代码的乐趣”时,Angie Jones 给了一个反直觉的答案:让它拿走。因为真正让工程师上瘾的快感,已经上移到了“构建 Agent 系统”这一层。这场演讲,几乎是给所有 AI 从业者的一次职业认知重构。
当所有人都在喊“学 AI”,Greg Isenberg 却给了一个更残酷也更现实的判断:单学 AI,已经不够了。这支视频里,他直接点名6种在未来几年里真正稀缺、能放大 AI 价值的技能组合,很多甚至和代码无关。