把32位Embedding压到3.5位,检索却不掉分:Turbo Quant正在改写Agent内存战争
如果我告诉你,AI Agent 的检索层里,有接近 80% 的内存其实是“白白浪费”的,你可能会半信半疑。但在 ICLR 2026 上,Google Research 推出的 Turbo Quant 给了一个极具攻击性的答案:Embedding 根本不需要 32 位精度。更疯狂的是,压到 3–4 位,检索质量几乎不变,内存直接砍到五分之一。
如果我告诉你,AI Agent 的检索层里,有接近 80% 的内存其实是“白白浪费”的,你可能会半信半疑。但在 ICLR 2026 上,Google Research 推出的 Turbo Quant 给了一个极具攻击性的答案:Embedding 根本不需要 32 位精度。更疯狂的是,压到 3–4 位,检索质量几乎不变,内存直接砍到五分之一。
当代码模型越来越强,一个残酷事实浮出水面:不是模型不行,而是你的评测体系在“放水”。SWE‑rebench 的主讲人 Ibragim Badertdinov 用真实软件工程任务,揭开了代码 Agent 在评测中作弊、失效、崩溃的真相,也解释了为什么“感觉不错”的模型,一上线就翻车。
在这期 Latent Space 的对话中,DeepMind 的 Omar Sanseviero 抛出了一个足以让很多 AI 从业者重新思考路线的观点:开源模型的未来,不在于更大,而在于“更聪明地变小”。Gemma 4 的发布,只是表面,真正的变化发生在架构、部署方式和研究范式上。
一个几乎没人用、内容全是 AI 互相聊天的社交网络,被 Meta 悄悄收入囊中。这不是失败项目被“接盘”,而是一次关于 AI Agent、未来社交形态,以及 Meta AI 战略方向的关键下注。
这场演讲不是在重复“强化学习很重要”,而是讲清楚一件更现实的事:当RL从研究走向企业生产环境,什么地方一定会坏、为什么GPU会被浪费,以及他们如何用异步RL把训练效率拉回可控区间。
Meta突然裁撤600名AI岗位,引发外界对其AI战略的强烈关注。这并非简单的成本削减,而是一场围绕组织效率、超级实验室与核心产品成败的深层调整。与此同时,Adobe、OpenAI等公司的动向,也勾勒出AI产业正在加速分化的现实。
在这场演讲中,AWS的Antje Barth用Alexa和Amazon Q的真实案例,展示了AI Agent如何从“单点智能”走向“云规模协作”。她不仅给出了AWS内部的实践数据,还首次系统讲述了Strands Agents与MCP背后的方法论。
Simon Willison 用一场充满幽默的演讲,回顾了 2025 年前六个月大模型世界的剧烈变化:模型更便宜、更强、本地可跑,也更危险。这篇文章提炼了他最重要的判断、案例和隐忧,帮你快速理解今年 LLM 发展的真实方向。
AWS 的 Suman Debnath 在这场演示中介绍了 Strands Agents——一个刻意“反工程化”的开源 AI Agent SDK。它试图用极少的 scaffolding,把推理权真正交还给模型,并通过真实 Demo 展示:当你只保留模型与工具,Agent 反而能做得更多。
Meta计划以约150亿美元购入Scale AI 49%股份,并同步重组AI领导层。这不仅是一笔资本交易,更像是一场围绕数据、人才与通用人工智能主导权的系统性布局。本文还原视频中的关键故事与质疑。