他不让LLM先读文档:一次绕开“多模态税”的混合RAG实战
正在加载视频...
视频章节
大多数RAG系统一开始就犯了一个隐形但昂贵的错误:先把文档丢给大模型再说。Abed Matini 在这场分享中反其道而行,提出“绕过多模态税”的混合RAG架构,用SQL、RRF和实时遥测,把聊天机器人从“烧Token的玩具”拉回“可控的工程系统”。
他不让LLM先读文档:一次绕开“多模态税”的混合RAG实战
大多数RAG系统一开始就犯了一个隐形但昂贵的错误:先把文档丢给大模型再说。Abed Matini 在这场分享中反其道而行,提出“绕过多模态税”的混合RAG架构,用SQL、RRF和实时遥测,把聊天机器人从“烧Token的玩具”拉回“可控的工程系统”。
真正昂贵的不是模型,而是你一上来就把文档喂给它
Abed Matini 的开场非常“反直觉”:RAG系统最大的浪费,往往发生在用户还没问第一个问题之前。常见做法是——拖一个PDF、Word,甚至图片进聊天窗口,让LLM“先理解一下”。问题是,这一步已经在悄悄扣Token,而且是无法产生任何业务价值的Token。
他把这称为一种“多模态税”(Multimodal Tax):你为了方便,让模型提前处理各种模态的数据,结果是在没有查询、没有上下文的情况下,就为解析、嵌入、理解付了账。更糟的是,这个成本在规模化时会线性放大。
第二个问题更工程化:当你把向量检索、关键词搜索、语义搜索、Agent工具一股脑塞进一个对话机器人里,生产环境会迅速失控。工具太多,路由逻辑复杂,调试和维护成本飙升。Matini 的核心观点是:不要把所有能力都压在LLM那一层。
先“备菜”,再点菜:把文档准备阶段从对话中剥离
他给出的第一个关键重构是:把文档摄取(ingest)和用户对话彻底分离。文档不是在聊天开始时才被模型“看见”,而是在后台提前被结构化、切块、索引好。
在演示中,他用的是一个本地运行的FAQ助手,场景是员工手册问答。HR上传文档后,系统并不会立刻调用LLM,而是进入一个“准备态”:解析文档结构、做chunking、写入数据库。只有当用户真正提问时,模型才被唤醒。
这个顺序的改变,看似只是流程调整,实则直接解决了两个痛点:
- Token只花在“回答问题”上,而不是“预热文档”上
- 聊天机器人不再背负复杂的数据处理逻辑
这也是他反复强调的“framework-free hybrid RAG”的第一层含义:不是不用框架,而是不被单一RAG范式绑死。
SQL + RRF:不用向量数据库也能打的混合检索
在技术选型上,Matini 再次走了一条“非主流”路线。他的核心存储是 PostgreSQL,而不是专用向量数据库。向量当然有,但不是唯一主角。
检索阶段,他组合了多种信号:关键词匹配、语义相似度,以及最终用 RRF(Reciprocal Rank Fusion) 做结果融合。RRF的好处是简单、可解释,而且非常适合把“传统搜索”和“语义搜索”捏在一起。
更重要的是,这一切都发生在SQL层。你可以清楚地看到每一次检索是如何打分、排序、融合的,而不是把希望寄托在一个黑盒向量召回上。
他还花了大量时间讲文档切块(chunking):按标题、按段落、固定长度、句子级。结论并不花哨——没有银弹,只有适配场景。FAQ型内容和法律文本、技术文档,用同一种chunk策略,几乎注定效果不稳定。
Agent还是Direct RAG?他给了一个冷静的分界线
在Agent大热的当下,Matini 并没有站队“万物皆Agent”。他明确区分了两种模式:Direct RAG 和 Agent Mode。
Direct RAG 的优势是确定性强、路径短、可控,适合大多数标准问答场景;Agent模式则更灵活,能调用多个工具,但复杂度和不可预测性也随之上升。
他的判断标准很工程化:如果你的问题90%都能通过一次检索+一次生成解决,引入Agent只是在增加故障面。Agent不是升级版RAG,而是另一种权衡。
因此,在他的系统里,Agent是“可选能力”,而不是默认路径。这种克制,在今天的技术分享中并不多见。
没有遥测的RAG,只是“感觉还行”
最后一个被很多团队忽略的部分,是遥测(Telemetry)和护栏(Guardrails)。Matini 强调:如果你不知道每一次回答用了哪些数据、走了哪条检索路径、花了多少Token,那你其实无法优化系统。
他在应用层加入了实时遥测,监控检索命中、排序结果、响应时间和Token消耗。这些数据不是为了做炫酷Dashboard,而是为了在系统“变贵”“变慢”“变傻”之前就发现问题。
护栏同样重要:不是所有问题都应该被回答,不是所有上下文都应该被送进模型。RAG系统一旦进入生产环境,安全和边界就是架构问题,而不是Prompt问题。
总结
这场分享最有价值的地方,不在某个具体技术栈,而在一种工程取向:让LLM只做它最擅长、也最昂贵的那一小步。提前准备数据、用SQL和RRF把检索变透明、谨慎引入Agent、用遥测对抗“感觉良好”。
如果你正在做RAG系统,可以从一个小动作开始:统计一下,你的Token到底花在了“回答问题”上,还是花在了“让模型先读一遍资料”上。这个数字,往往比任何新模型都更能决定系统的成败。
关键词: 混合RAG, 多模态, Token成本, SQL检索, RRF
事实核查备注: 需要核查:演讲者姓名拼写(Abed/Abid Matini)、演讲所属活动名称(AI Engineer World Fair 2026)、RRF在系统中的具体实现细节是否有代码示例、是否明确说明未使用专用向量数据库