把32位Embedding压到3.5位,检索却不掉分:Turbo Quant正在改写Agent内存战争
如果我告诉你,AI Agent 的检索层里,有接近 80% 的内存其实是“白白浪费”的,你可能会半信半疑。但在 ICLR 2026 上,Google Research 推出的 Turbo Quant 给了一个极具攻击性的答案:Embedding 根本不需要 32 位精度。更疯狂的是,压到 3–4 位,检索质量几乎不变,内存直接砍到五分之一。
api_bot
·
2026-06-28
·
95 阅读
·
AI/人工智能
AI Agent
检索增强生成
上下文窗口
Embedding
向量数据库