AI真正的护城河不是算力:中心那口“数据黑洞”正在吞噬一切

AI PM 编辑部 · 2026年06月19日 · 98 阅读 · AI/人工智能

正在加载视频...

视频章节

如果你还在把 AI 的差距归因于算力或参数量,这期 Dwarkesh Patel 的讨论会直接把这个认知打碎。真正拉开差距的,是一口几乎无法复制的“数据黑洞”——由人类专家经验、长期训练与任务缝合而成,正在让开源模型与前沿模型越拉越远。

AI真正的护城河不是算力:中心那口“数据黑洞”正在吞噬一切

如果你还在把 AI 的差距归因于算力或参数量,这期 Dwarkesh Patel 的讨论会直接把这个认知打碎。真正拉开差距的,是一口几乎无法复制的“数据黑洞”——由人类专家经验、长期训练与任务缝合而成,正在让开源模型与前沿模型越拉越远。

最反直觉的一点:智能的核心不是规模,而是“样本效率”

视频一开场就抛出一个容易被忽略的定义:智能,本质上是样本效率。也就是说,用尽可能少、但高价值的样本,学会你最终想让模型胜任的能力。听起来像一句教科书废话,但它直接击中了当前 AI 竞赛的盲区——我们太习惯谈参数、算力、token,却很少认真讨论“这些数据是否真的教会了模型关键能力”。Dwarkesh 强调,人类专家之所以稀缺,不是因为他们知道得多,而是因为他们知道哪些例子最重要。这种能力,恰恰不是靠简单扩展网页语料就能获得的。

人类专家数据:贵得离谱,但贵得有道理

第二个核心冲击来自对“人类专家数据”的描述:高度任务定制、极其细碎、几乎不可复用。它不是你抓一批标注工人就能解决的问题,而是要真正的领域专家,把多年隐性经验拆解成模型能学的形式。视频中用词非常重——这种数据的规模很快会到“十亿、甚至百亿级别的美元”。这不是夸张,而是在提醒:真正值钱的不是模型架构,而是把专家经验系统性地注入模型的过程。

把几十年的课程缝在一起,才是前沿模型的真实训练方式

有一个比喻特别残忍:想象一个模型,等于连续上了几十年、跨学科、层层递进的课程,而且这些课程不是孤立的,而是被精心“缝合”在一起。这里的关键词不是“多”,而是“顺序”和“组合”。这种训练方式决定了模型能否在复杂任务中迁移、泛化,而这恰恰是普通大规模预训练最容易缺失的部分。

四个月的差距背后,是一个不可见的“数据黑洞”

Epoch 的一项报告被反复引用:开源模型平均落后最前沿模型约四个月。听起来不算夸张,但 Dwarkesh 的判断更尖锐——这四个月的差距背后,是一个“难以想象规模的数据黑洞”。不是大家不愿意开源,而是这些数据本身就很难被复制、分发,甚至很难被完整描述。你可以复现论文,却复现不了那套持续吸收高价值数据的管道。

为什么“再 scale 一点”的乐观主义,可能完全错了

视频后半段集中反驳了几个常见乐观观点:比如“我们只是还没 scale 到位”。Dwarkesh 的回应很直接——问题不在同一条 scaling curve 上。有些模型的进步,来自完全不同的数据来源和训练目标。即使算力成本持续下降,这些模型依然可能长期处于领先,因为它们在吸收的是你根本拿不到的数据类型。

总结

这期讨论真正值得 AI 从业者反复咀嚼的,不是悲观或乐观,而是视角的转变:竞争优势正在从“谁算得更快”转向“谁更早、更系统地进入那口数据黑洞”。对个人和团队而言,takeaway 很现实——如果你做模型,不要只盯着架构;如果你做应用,想清楚你能否产生独特的数据回路。最后留一个问题:在你的领域,有没有一种人类专家经验,是现在还没人认真地喂给模型的?


关键词: 样本效率, 人类专家数据, 数据黑洞, 开源模型, 模型训练

事实核查备注: 需要核查:1)Epoch 关于开源模型落后前沿模型约四个月的具体报告;2)视频中关于人类专家数据成本达到十亿、百亿级的原始表述;3)“样本效率”作为智能定义的原话语境。