文章

把32位Embedding压到3.5位,检索却不掉分:Turbo Quant正在改写Agent内存战争

把32位Embedding压到3.5位,检索却不掉分:Turbo Quant正在改写Agent内存战争

如果我告诉你,AI Agent 的检索层里,有接近 80% 的内存其实是“白白浪费”的,你可能会半信半疑。但在 ICLR 2026 上,Google Research 推出的 Turbo Quant 给了一个极具攻击性的答案:Embedding 根本不需要 32 位精度。更疯狂的是,压到 3–4 位,检索质量几乎不变,内存直接砍到五分之一。

api_bot · 2026-06-28 · 95 阅读 · AI/人工智能
NVIDIA研究员直言:扩散模型未必需要50步,真正瓶颈另有其人

NVIDIA研究员直言:扩散模型未必需要50步,真正瓶颈另有其人

如果你还在默认“高质量扩散=50步以上”,这场来自NVIDIA的分享会让你重新思考。Ziv Ilan用20分钟拆解了一个残酷现实:限制生成式视觉模型落地的,从来不是效果,而是速度、成本和工程成熟度。

api_bot · 2026-06-16 · 156 阅读 · AI/人工智能
把上下文拉到500万Token,Together AI是怎么把H100榨干的

把上下文拉到500万Token,Together AI是怎么把H100榨干的

如果我告诉你:在8张H100上训练一个3B模型,光是把模型参数放进去就会直接OOM,你可能会觉得夸张。但Together AI的Max Ryabinin不仅验证了这一点,还一路把上下文长度推到了500万Token。这不是炫技,而是一场关于“内存从哪儿漏光”的硬核拆解。

api_bot · 2026-06-08 · 186 阅读 · AI/人工智能
当所有人嘲笑谷歌时,TPU和Transformer早已埋下胜负手

当所有人嘲笑谷歌时,TPU和Transformer早已埋下胜负手

一年前,很多人断言“谷歌在AI竞赛中已经出局”。但MatX CEO、前Google TPU架构师 Reiner Pope 给出了完全相反的答案:今天AI算力格局的关键,恰恰来自谷歌十年前那些看似笨拙、过早、甚至被低估的决定。这是一场关于芯片、Transformer和‘机械同理心’的硬核复盘。

api_bot · 2026-02-26 · 161 阅读 · AI/人工智能
从一行代码到整个代码库:编码评测的时间尺度革命

从一行代码到整个代码库:编码评测的时间尺度革命

Naman Jain 回顾了四年编码评测工作的演进:从毫秒级的代码补全,到耗时数小时的代码库优化。他提出“动态评测”和“时间作为控制旋钮”的方法,直面数据污染、奖励黑客与长周期任务评估三大难题,为下一代 AI 编码代理划定了清晰方向。

api_bot · 2025-12-15 · 151 阅读 · AI/人工智能