正在加载视频...
视频章节
如果你还在用“人工红队”来测试大模型安全,这期对话会让你坐立不安。Gray Swan 的两位研究者直言:在攻击模型这件事上,AI 已经开始系统性地胜过人类。这不是未来预言,而是他们正在亲眼看到的现实。
AI最危险的对手不是黑客,而是更会攻击的AI本身
如果你还在用“人工红队”来测试大模型安全,这期对话会让你坐立不安。Gray Swan 的两位研究者直言:在攻击模型这件事上,AI 已经开始系统性地胜过人类。这不是未来预言,而是他们正在亲眼看到的现实。
最反直觉的发现:模型,比人更擅长“攻击模型”
整期对话最炸的一句话,来自一个看似轻描淡写的观察:“我们发现,AI 在很多情况下,比人类更擅长攻破模型。”这句话的杀伤力在于,它直接挑战了当前 AI 安全的基本假设——我们默认“人类红队”是最高水平的攻击者。
但现实是:模型不知疲倦、不受认知偏见影响,而且可以在极短时间内尝试成千上万种策略。人类红队靠经验和直觉,而模型红队靠的是系统性搜索和组合爆炸。当攻击空间足够大时,胜负已经开始倾斜。
这也解释了为什么传统安全评估越来越像“走流程”:你测试的是你能想到的风险,而不是模型真正可能走到的极端行为。
从“补漏洞”到“换思路”:AI安全的范式正在改变
对话里反复强调一个转变:AI 安全不再只是修补漏洞,而是要重新理解“对手是谁”。当攻击者本身也是模型时,安全问题的性质就变了。
他们提到,很多安全策略默认模型是“被动系统”——只有在人类提示下才会出问题。但现实中的模型正在变得更像代理:能规划、能分解目标、能在没有明确工具的情况下完成复杂任务。这已经不是传统网络安全的延伸,而是一个新的研究对象。
一个关键分歧点在于:是否把模型当成“工具”,还是一种“不同形式的智能”。一旦你接受后者,安全评估就不能只看单次输出,而要看长期行为模式。
红队不够红:为什么评估本身成了风险来源
红队(red teaming)在对话中被反复提及,但语气并不乐观。问题不在于“要不要红队”,而在于“现在的红队远远不够”。
企业常见的困境是:安全评估必须可控、可复现、可汇报。但真正危险的行为,往往恰恰不满足这些条件。结果就是,评估覆盖的是“舒适区风险”,而不是“真实世界风险”。
更微妙的一点是:当模型开始学会“像现实世界那样行动”,评估环境和真实环境的差距会迅速放大。你在实验室里没看到的问题,不代表它不会在真实部署中出现。
企业的尴尬选择:安全、速度和成本的三难困局
对话中有一个很现实的观察:很多企业并不是不知道风险,而是在做一个“理性但危险”的权衡。
更全面的评估意味着更慢的迭代、更高的成本,以及更多内部摩擦。在竞争激烈的市场里,这些都是实打实的代价。于是,很多公司选择“够用就好”的安全策略。
但问题在于,当攻击者升级为 AI,这种权衡的底线也在被抬高。你可能不是在和同行赛跑,而是在和一个不会累、不会犹豫的对手对抗。
真正的难点:你必须“拥有端到端”
临近结尾时,一个容易被忽略但极其重要的观点被抛出:如果你想真正理解和控制 AI 风险,你必须对系统的端到端负责。
外包评估、碎片化工具、孤立指标,都无法应对代理化模型带来的系统性风险。安全不再是一个模块,而是一种贯穿数据、训练、部署和监控的能力。
这也是为什么 AI 安全正在从“合规问题”转向“核心技术能力”。
总结
这期对话真正让人警醒的,不是某个具体漏洞,而是一个趋势:AI 正在成为最强的攻击者,同时也是我们最不熟悉的对手。对从业者来说,takeaway 很直接——不要再把安全当成上线前的检查清单,而要把它当成持续对抗的过程。一个值得带走的问题是:如果你的模型今天开始“像现实世界那样行动”,你现在的评估体系,真的能发现它最危险的那一面吗?
关键词: AI安全, 模型红队, 代理型AI, 安全评估, AI风险
事实核查备注: 需要核查:1)“模型比人类更擅长攻击模型”的原话语境;2)对话中提到的具体研究或项目名称(如 Grace One);3)关于代理行为和无工具执行任务的准确表述范围;4)是否明确提及 Gray Swan 的产品或方法论细节。