新加坡外长的“第二大脑”,如何意外点燃自治代理工厂
一个反直觉的事实:推动自治代理走向现实的,不是更大的模型,而是“记忆”。当新加坡外交部长公开展示自己的第二大脑时,一家名为 NanoClaw 的项目突然被推到聚光灯下。这期 Latent Space 的对谈,给出了自治工作代理真正可落地的蓝图。
一个反直觉的事实:推动自治代理走向现实的,不是更大的模型,而是“记忆”。当新加坡外交部长公开展示自己的第二大脑时,一家名为 NanoClaw 的项目突然被推到聚光灯下。这期 Latent Space 的对谈,给出了自治工作代理真正可落地的蓝图。
大多数RAG系统一开始就犯了一个隐形但昂贵的错误:先把文档丢给大模型再说。Abed Matini 在这场分享中反其道而行,提出“绕过多模态税”的混合RAG架构,用SQL、RRF和实时遥测,把聊天机器人从“烧Token的玩具”拉回“可控的工程系统”。
当所有人沉迷于“让AI写代码、马上上线”,MongoDB的Apoorva Joshi却抛出一个反直觉结论:真正决定AI系统成败的,已经不是代码,而是你在动手前的系统设计。这场演讲,用一个真实的医保理赔案例,把AI从想法走向生产的底层逻辑彻底讲透。
如果我告诉你:在某些场景下,向量检索和知识图谱都不是最优解,你会信吗?Luis Romero-Sevilla 在这场演讲中抛出一个反直觉结论——当“所有文档都相关、而且还在高速变化”时,真正的突破点不在检索,而在上下文本身。
如果我告诉你,AI Agent 的检索层里,有接近 80% 的内存其实是“白白浪费”的,你可能会半信半疑。但在 ICLR 2026 上,Google Research 推出的 Turbo Quant 给了一个极具攻击性的答案:Embedding 根本不需要 32 位精度。更疯狂的是,压到 3–4 位,检索质量几乎不变,内存直接砍到五分之一。
你以为 AI Agent 失败是模型推理不够强?Sonam Pankaj 在这场演讲里给出一个更残酷的答案:大多数 Agent 其实死在了“检索之后”。评估信号进了 dashboard,却从没回到系统里,Agent 注定一错再错。
如果你觉得RAG做不好,是模型不够强,那可能方向就错了。Red Hat 工程师 Cedric Clyburn 用一场演讲抛出一个反直觉观点:真正限制大语言模型落地的,不是生成能力,而是我们如何“结构化”那些混乱的文档。
大多数AI Agent失败,不是因为模型不够强,而是因为没人知道如何“持续改进”它们。Nearform 技术负责人 Alfonso Graziano 给出了一条反直觉的答案:让 AI 自己来优化 AI。结果很残酷也很惊人——18% 到 83%,只用了 10 轮迭代。
如果你还在用 benchmark 分数评估 AI Agent,那你已经落后一个时代。来自 Meta 超级智能实验室的 Nishant Gupta 直言:高分模型,正在生产环境里悄悄失控。真正决定生死的,不是准确率,而是系统是否“可靠地完成事情”。这场关于 AI 评估的范式转移,正在重塑整个行业。
如果你以为大模型的下一步只是更长的上下文窗口,那你可能已经落后了。这场来自 Sequoia 的对谈抛出一个更激进的判断:真正的竞争,不在“记得更多”,而在“学得不停”。记忆与持续学习,正在重塑模型、公司,甚至整个 AI 产业的形态。