RAG 不是终局:这群人想把“记忆”真正塞进模型大脑
正在加载视频...
视频章节
如果你以为大模型的下一步只是更长的上下文窗口,那你可能已经落后了。这场来自 Sequoia 的对谈抛出一个更激进的判断:真正的竞争,不在“记得更多”,而在“学得不停”。记忆与持续学习,正在重塑模型、公司,甚至整个 AI 产业的形态。
RAG 不是终局:这群人想把“记忆”真正塞进模型大脑
如果你以为大模型的下一步只是更长的上下文窗口,那你可能已经落后了。这场来自 Sequoia 的对谈抛出一个更激进的判断:真正的竞争,不在“记得更多”,而在“学得不停”。记忆与持续学习,正在重塑模型、公司,甚至整个 AI 产业的形态。
最反直觉的一点:模型从来没有“训练完成”
对谈一开场就戳破了一个行业里默认接受、但很少被认真质疑的前提:模型是“训练完再部署”的。Engram 的创始人直接抛出一个不同的世界观——“Our models are always training.” 这句话的杀伤力在于,它否定的不是某个技巧,而是整个模型生命周期的设计方式。
在传统认知里,预训练负责通用能力,微调解决下游任务,推理阶段只读不写。但现实是,模型每天面对的新数据、新偏好、新约束,早已超过一次性训练可以覆盖的范围。于是我们看到各种补丁式方案:RAG、缓存、外挂数据库、长上下文窗口。这些方案能用,但本质都是把‘学习’外包出去。
Engram 的核心判断是:记忆和持续学习不是两个问题,而是一枚硬币的正反面。如果模型不能把经验内化进自身参数,它就永远只能靠“查资料”来装聪明。
外置记忆的繁荣,其实是一次集体妥协
当前主流方案为什么几乎都选择“外置记忆”?原因并不神秘:安全、可控、成本可预期。RAG 让模型不用记住事实,只要知道去哪找;KV cache 和上下文扩展,让模型在推理时“临时记住”更多东西。
但问题在于,这些方案都把复杂度推到了推理阶段。上下文越长,token 成本越高;检索越频繁,系统延迟越不可控。对谈中反复出现的一个关键词是 trade-off:更多前置计算,换取更便宜、更稳定的推理。
Engram 的实践方向很明确:通过持续的、团队级别的训练,把高频、强关联的知识压缩进权重里。结果是上下文 token 显著减少,同时质量反而提升。这不是魔法,而是承认一个事实——有些知识,本来就应该“长在脑子里”。
Engram 在做什么:不是一个模型,而是一套学习架构
当被问到具体架构时,讨论迅速从“概念”落到“工程”。Engram 并不试图训练一个包打天下的超级模型,而是围绕 workspace 和 team 构建持续演化的模型实例。
技术手段并不陌生:adapter fine-tuning、监督微调、强化学习、蒸馏。但关键不在方法列表,而在节奏——这些训练不是一次性发生,而是伴随模型使用不断进行。模型在特定团队、特定数据分布下形成‘个性’,而不是永远回到一个抽象的通用状态。
这也解释了为什么他们认为“每个人、每个团队都会有自己的模型”。不是因为基础模型不够强,而是因为激励、数据归属和基础设施已经发生变化。
从梦到记忆:神经科学给了他们底气
这场对谈里最有趣的部分,来自两位创始人的神经科学背景。当话题转向“模型是否需要像人一样做梦”,答案并不浪漫,但很实在。
人类记忆本身就是有损的、会重组的。梦的意义不在于回放事实,而在于重排经验、探索状态空间。持续学习的 canonical 例子,正是给系统时间‘退回后台’,在不被即时目标打断的情况下更新内部表示。
这也回应了一个老争论:模型里的大量事实记忆是 feature 还是 bug?他们的态度很明确——把算法和数据库对立起来,本身就是一个伪命题。真正重要的是:哪些信息值得被压缩进权重,哪些适合外部化。
未来五到十年:RAG 会被“吃掉”一半
当话题来到未来,对谈的基调反而变得冷静。RAG 不会消失,但它的边界会被重新划定。高频、强关联、需要快速联想的知识,会越来越多地被内化;低频、长尾、强审计需求的事实,继续留在外部系统。
更重要的变化在组织层面:基础模型实验室不再是唯一主角。随着数据私有化、推理成本压力、以及持续学习基础设施的成熟,“人人有模型”不再是一句口号,而是一种经济选择。
甚至在更远的地方,他们提到了一个耐人寻味的比喻:模型将成为连接数据平面的神经接口,而不是一个孤立的推理引擎。
总结
这场对谈真正颠覆人的地方,不是某个新算法,而是一个判断:AI 的下一个竞争优势,来自“记住并持续改变”的能力,而不是一次性学得多好。对从业者来说,值得思考的不是要不要上 RAG,而是:你的系统里,哪些知识值得被内化?你是否在为持续学习留接口?当模型开始‘活着’,你的产品和组织是否准备好了?
关键词: 持续学习, 模型记忆, RAG, 上下文窗口, 推理成本
事实核查备注: 需核查:Engram 创始人姓名(视频中提到 Don Biderman / Jessy Lin 的准确拼写);视频发布时间与时长;“Our models are always training”是否为原话;关于 token 减少与质量提升是否有具体量化数据。