新加坡外长的“第二大脑”,如何意外点燃自治代理工厂
一个反直觉的事实:推动自治代理走向现实的,不是更大的模型,而是“记忆”。当新加坡外交部长公开展示自己的第二大脑时,一家名为 NanoClaw 的项目突然被推到聚光灯下。这期 Latent Space 的对谈,给出了自治工作代理真正可落地的蓝图。
一个反直觉的事实:推动自治代理走向现实的,不是更大的模型,而是“记忆”。当新加坡外交部长公开展示自己的第二大脑时,一家名为 NanoClaw 的项目突然被推到聚光灯下。这期 Latent Space 的对谈,给出了自治工作代理真正可落地的蓝图。
当所有人都在卷模型、卷参数时,Meta 的一线工程负责人却抛出一个反直觉判断:AI 代理真正的瓶颈不是“聪不聪明”,而是“靠不靠谱”。更危险的是,很多 AI 故障并不是模型犯错,而是基础设施把小错放大成事故。
如果你以为用强化学习修ETL,是让系统更“聪明”,那你会被这场分享当头一棒。Anna Marie Benzon 用一套带着“安全护栏”的RL Agent,把原本2.5个工作日的人工恢复,压缩到分钟级——而最大功臣,恰恰不是RL本身。
一个看似杂谈的播客,其实暴露了三个正在同时发生的行业拐点:创作者经济正在被高成本反噬,Meta 把 AI 塞进眼镜想重做现实入口,而 GPT 5.6 的“有限发布”背后,是模型分级、蒸馏和监管的全面博弈。对 AI 从业者来说,这是一集不能只当背景音的视频。
多数公司还在Demo里炫耀AI Agent时,OpenGov已经把它塞进了真实的政府ERP系统,而且还规模化跑了起来。更反直觉的是,他们成功的关键,不是更大的模型,而是一整套工程化、可控、可观测的Agent体系。
如果你还在用 benchmark 分数评估 AI Agent,那你已经落后一个时代。来自 Meta 超级智能实验室的 Nishant Gupta 直言:高分模型,正在生产环境里悄悄失控。真正决定生死的,不是准确率,而是系统是否“可靠地完成事情”。这场关于 AI 评估的范式转移,正在重塑整个行业。
如果你还在用“人工红队”来测试大模型安全,这期对话会让你坐立不安。Gray Swan 的两位研究者直言:在攻击模型这件事上,AI 已经开始系统性地胜过人类。这不是未来预言,而是他们正在亲眼看到的现实。
如果你以为AI竞赛只取决于算力、模型和人才,这期《AI Daily Brief》会让你重新校准认知。美国政府直接出手,迫使Anthropic关闭 Mythos/Fable,不只是封了一个模型,而是改写了“谁能继续留在赛道上”的规则。这是一场技术让位于政治的真实演示。
Claude史上最强的公开模型,只活了76小时。不是Bug,不是公司内斗,而是一纸“国家安全”指令。更反直觉的是:Anthropic并不认同这个决定。这可能是AI监管真正的分水岭。
一个模型,24小时烧掉近1000美元,却让作者断言“这是下一个范式转移”。Claude Fable 5(以及被加了“安全带”的 Mythos)正在重新定义什么叫顶级 AI,但它的真正门槛,不是能力,而是钱包。