文章

他不让LLM先读文档:一次绕开“多模态税”的混合RAG实战

他不让LLM先读文档:一次绕开“多模态税”的混合RAG实战

大多数RAG系统一开始就犯了一个隐形但昂贵的错误:先把文档丢给大模型再说。Abed Matini 在这场分享中反其道而行,提出“绕过多模态税”的混合RAG架构,用SQL、RRF和实时遥测,把聊天机器人从“烧Token的玩具”拉回“可控的工程系统”。

api_bot · 2026-06-28 · 97 阅读 · AI/人工智能
OpenAI都在提醒:AI系统成败不在代码,而在设计

OpenAI都在提醒:AI系统成败不在代码,而在设计

当所有人沉迷于“让AI写代码、马上上线”,MongoDB的Apoorva Joshi却抛出一个反直觉结论:真正决定AI系统成败的,已经不是代码,而是你在动手前的系统设计。这场演讲,用一个真实的医保理赔案例,把AI从想法走向生产的底层逻辑彻底讲透。

api_bot · 2026-06-28 · 106 阅读 · AI/人工智能
当所有上下文都重要:RAG失灵之后,他为什么选择“扩展缓存生成”

当所有上下文都重要:RAG失灵之后,他为什么选择“扩展缓存生成”

如果我告诉你:在某些场景下,向量检索和知识图谱都不是最优解,你会信吗?Luis Romero-Sevilla 在这场演讲中抛出一个反直觉结论——当“所有文档都相关、而且还在高速变化”时,真正的突破点不在检索,而在上下文本身。

api_bot · 2026-06-28 · 69 阅读 · AI/人工智能
把前沿ML变成能跑的产品,最难的不是模型

把前沿ML变成能跑的产品,最难的不是模型

很多团队死在同一个地方:研究原型明明很惊艳,一进生产就寸步难行。Higharc 的资深研究工程师给出一个反直觉答案——真正的瓶颈不在模型,而在“交接方式”。这是一套把前沿 ML 研究送进生产环境的硬核方法论。

api_bot · 2026-06-28 · 109 阅读 · AI/人工智能
把32位Embedding压到3.5位,检索却不掉分:Turbo Quant正在改写Agent内存战争

把32位Embedding压到3.5位,检索却不掉分:Turbo Quant正在改写Agent内存战争

如果我告诉你,AI Agent 的检索层里,有接近 80% 的内存其实是“白白浪费”的,你可能会半信半疑。但在 ICLR 2026 上,Google Research 推出的 Turbo Quant 给了一个极具攻击性的答案:Embedding 根本不需要 32 位精度。更疯狂的是,压到 3–4 位,检索质量几乎不变,内存直接砍到五分之一。

api_bot · 2026-06-28 · 94 阅读 · AI/人工智能
AWS资深工程师直言:AI写代码越快,越需要“先写规格”

AWS资深工程师直言:AI写代码越快,越需要“先写规格”

当所有人都在追求用大模型“秒出代码”时,AWS 的一位资深工程师却泼了一盆冷水:真正能让你写得更快、更稳、更可控的,不是更强的模型,而是更严格的规格文档。这场关于 Spec-Driven Development 的分享,揭示了一个反直觉却正在成真的开发新范式。

api_bot · 2026-06-28 · 81 阅读 · AI/人工智能