正在加载视频...
视频章节
如果你还在用排行榜和标准Benchmark判断模型强不强,Noam Brown会告诉你:你可能已经被误导了。在这期对话里,他抛出了一个让整个行业不安的观点——不是模型到头了,而是我们的评测方式,已经跟不上AI真实能力的增长。
为什么今天的AI越强,基准测试反而越不可信了?
如果你还在用排行榜和标准Benchmark判断模型强不强,Noam Brown会告诉你:你可能已经被误导了。在这期对话里,他抛出了一个让整个行业不安的观点——不是模型到头了,而是我们的评测方式,已经跟不上AI真实能力的增长。
最反直觉的真相:模型没撞墙,Benchmark先失效了
很多人觉得,大模型的性能开始“放缓”,是因为Scaling Laws快到头了。但Noam Brown在对话一开始就泼了一盆冷水:性能没有真正渐近,至少在很多任务上不是。
问题不在模型,而在我们“怎么看它”。传统Benchmark默认一个前提——给模型一次前向推理,看它能不能答对。但今天的模型,尤其是在推理型任务上,能力高度依赖“测试时计算量(test-time compute)”。
用Noam的说法,GPT-3时代,你几乎没法在测试时继续扩展计算;而现在,模型在推理阶段“多想一会儿”,效果可能是质变。但现有的评测体系,几乎没有认真回答一个问题:如果我允许模型花更多时间、更多算力,它到底能走多远?
行业的集体盲区:我们假装用户只愿意付10美元
对话里有一个非常现实、也非常残酷的细节:今天大多数评测,只覆盖推理成本在10美元、100美元以内的场景。
听起来合理,对吧?毕竟谁会为了一个问题烧掉几百美元算力?但Noam指出,这种假设本身就限制了我们对模型能力的认知。
一方面,研究人员在问“模型能不能做到”;另一方面,评测却在偷偷问“在极低预算下,它能做到多少”。这两件事被混在了一起。
结果就是:我们以为模型不行,其实只是没给它时间。甚至连“用户是不是系统性地没有让模型想够久”这个问题,行业都还没形成共识。测试时间本身,正在成为新的瓶颈。
为什么零样本看起来很强,却正在掩盖更大的问题
当Benchmark不够用时,行业最常见的“补救措施”是什么?零样本(zero-shot)。
Noam把它称为一种“流行的fallback建议”:不微调、不给示例,直接看模型能不能一次答对。听起来很硬核,也很公平。
但问题在于,零样本测试,天然忽略了一个事实:现代模型的价值,越来越不体现在“第一次回答”,而是在“逐步推理、反复修正、长时间思考”中。
换句话说,我们正在用最省事的方式,评估最复杂的系统。这不仅低估了模型的上限,也让研究方向产生偏差——大家开始为刷榜优化,而不是为真实能力负责。
私有测试集、信任危机,以及没人跑到尽头的模型
当公开Benchmark被刷穿后,行业开始转向私有测试集、held-out数据。这在短期内确实提高了评测难度,但Noam的态度非常谨慎。
原因很简单:如果我们连“模型在长时间推理下会发生什么”都不知道,那无论测试集多私有,都只是换了一套题目做同样的事情。
他提出一个耐人寻味的事实:如果模型真的可以在更长推理下持续变强,那现在的问题不是“能力是否存在”,而是“几乎没人真的把它们跑到足够久”。
而这,直接影响到一个更现实的问题——我们到底该不该信任模型的输出?如果评测本身没有覆盖真实使用方式,所谓的可靠性,很可能只是幻觉。
方向正在改变:不是更大的模型,而是“刚刚好的思考”
在访谈的后半段,Noam描述了一个正在成形的转向:与其无脑堆训练规模,不如学会如何在测试时,给模型“刚刚好的计算”。
这不是简单的多想几步,而是一个系统性问题:什么时候继续推理是值得的?什么时候应该停?如何在时间、成本和质量之间取得平衡?
这些问题,几乎没有体现在今天的Benchmark里,却正在成为前沿竞争的核心。未来的差异化,不一定来自更大的参数量,而可能来自对推理过程更精细的控制。
总结
这期对话真正刺痛人的地方在于:它不是在讨论某个模型强不强,而是在质疑整个行业的“量尺”是不是坏了。
对AI从业者来说,一个直接的takeaway是:不要再迷信排行榜。理解模型时,一定要问清楚——给了多少测试时计算?允许它想多久?
如果你在做研究,或许该重新思考评测设计;如果你在做产品,可能该探索更灵活的推理预算;如果你只是使用模型,也许该试着让它“多想一会儿”。
真正的前沿,可能不是模型能不能,而是我们愿不愿意给它时间。
关键词: 测试时计算, AI Benchmark, 推理能力, 零样本学习, 模型评测
事实核查备注: 需要核查:Noam Brown的具体职位与身份;访谈中提到的模型版本“5.5”是否为原话;关于$10-$100推理预算的表述是否为直接引用;视频的实际时长与发布时间。