他不让LLM先读文档:一次绕开“多模态税”的混合RAG实战
大多数RAG系统一开始就犯了一个隐形但昂贵的错误:先把文档丢给大模型再说。Abed Matini 在这场分享中反其道而行,提出“绕过多模态税”的混合RAG架构,用SQL、RRF和实时遥测,把聊天机器人从“烧Token的玩具”拉回“可控的工程系统”。
大多数RAG系统一开始就犯了一个隐形但昂贵的错误:先把文档丢给大模型再说。Abed Matini 在这场分享中反其道而行,提出“绕过多模态税”的混合RAG架构,用SQL、RRF和实时遥测,把聊天机器人从“烧Token的玩具”拉回“可控的工程系统”。
如果我告诉你:在某些场景下,向量检索和知识图谱都不是最优解,你会信吗?Luis Romero-Sevilla 在这场演讲中抛出一个反直觉结论——当“所有文档都相关、而且还在高速变化”时,真正的突破点不在检索,而在上下文本身。
如果我告诉你,AI Agent 的检索层里,有接近 80% 的内存其实是“白白浪费”的,你可能会半信半疑。但在 ICLR 2026 上,Google Research 推出的 Turbo Quant 给了一个极具攻击性的答案:Embedding 根本不需要 32 位精度。更疯狂的是,压到 3–4 位,检索质量几乎不变,内存直接砍到五分之一。
当社交媒体在刷“RAG is dead”时,大多数人以为这只是又一次技术口嗨。但在这场由 Turbopuffer 工程师 Kuba Rogut 分享的演讲里,一个更扎心的事实浮出水面:不是 RAG 失效了,而是它已经跟不上真正严肃的 AI 搜索需求了。
很多人以为“语义搜索”是写代码的终极形态,但这场基准测试给了所有人一记冷水:Claude Code 默认不用语义搜索,反而效果更稳。TurboPuffer 的 Kuba 用真实数据对比了语义检索与 agentic 搜索,结论远比你想象复杂。
当所有人都在卷向量数据库、Agent 框架和微调时,Google DeepMind 的 Paige 却在台上泼了一盆冷水:这些东西,迟早都会被模型本身吞噬。这场长达一小时的分享,不是产品发布,而是一份来自一线的行业预言。
你以为Agent不聪明,是模型不够强?Leonie Monigatti在这场工作坊里抛出一个反直觉结论:Context Engineering里,真正决定成败的不是Prompt,而是Search。更残酷的是,80%的问题都出在这里。
当整个 AI 圈都在 All in 向量数据库时,Neo4j CEO Emil Eifrem 在这期 Latent Space 里泼了一盆冷水:向量很重要,但它们解决不了“理解”。真正让 AI 变聪明的,是知识图谱、上下文和可解释的结构。这是一场关于“AI 为什么还不够聪明”的深度对谈。
上下文窗口越来越大,很多人开始断言 RAG 已经过时。但在这场来自 IBM 的分享里,演讲者几乎是正面“开怼”:RAG 不但没死,而且远比你想象得复杂。更关键的是,他们把这些复杂性做成了一个开源栈——OpenRAG。
一场看似杂乱的科技直播,背后却藏着 2026 年最关键的几条产业暗线:Elon Musk 的“御用银行家”如何定义资本权力、Apollo 为什么躲过 SaaS 的集体绞杀、中国机器人为何突然全面提速。这不是新闻汇总,而是一份给 AI 从业者的趋势地图。