正在加载视频...
视频章节
很多团队以为把大模型接上业务就完成了AI转型,但Databricks技术负责人给了一个更残酷的答案:真正让企业AI崩盘的,从来不是模型不够强,而是你根本不知道它在“干什么”。这场演讲,第一次把“生产级AI Agent”的底层规则摊在台面上。
企业级AI Agent真正的门槛,不是模型而是这五根柱子
很多团队以为把大模型接上业务就完成了AI转型,但Databricks技术负责人给了一个更残酷的答案:真正让企业AI崩盘的,从来不是模型不够强,而是你根本不知道它在“干什么”。这场演讲,第一次把“生产级AI Agent”的底层规则摊在台面上。
所有AI项目都会走向同一个尴尬时刻
Sandipan Bhaumik一上来就戳破了一个行业幻觉:几乎每个企业的AI项目,都会在上线几周后陷入同一种混乱。
最初,一切都很美好。Demo很炫,PoC很顺,模型在测试集上表现“惊艳”。但几周后,业务方开始问同一个问题——“这AI到底在干嘛?”没有人能给出清晰答案。
这是Sandipan在加入Databricks后的两年里,几乎在每一次客户会议中反复看到的场景。不是模型不工作,而是它的行为开始变得不可解释、不可预测,也不可控。
真正的问题不是“AI准不准”,而是:
- 它什么时候开始变差的?
- 是数据变了,还是提示词变了?
- 它犯错时,有没有人能及时发现?
当这些问题没人回答,AI项目就会从“创新试点”迅速变成“风险源头”。
从无数失败里总结出的五根支柱
Sandipan说,他不是一开始就有答案,而是在无数次“救火”之后,才提炼出一个共识框架:企业级AI Agent,必须建立在五个支柱之上。
这五个支柱不是技术清单,而是一套“生产思维”。缺任何一个,AI都只能停留在演示阶段。
第一根柱子是Evaluation。不是简单算准确率,而是持续、系统地回答:这个Agent在真实业务里表现得如何?
第二根是Observability。你是否能在AI出问题之前,就看到异常信号?
第三根是Data Foundation。模型再强,脏数据也能把它拖进深渊。
第四根是Multi-Agent Orchestration。当一个Agent不够用时,你有没有清晰的协作模式,而不是一团乱麻?
第五根是Governance。谁能改它?谁来负责?出了事算谁的?
这不是“成熟度模型”,而是一张生死线。
Evaluation不是打分,而是三层防线
很多团队做Evaluation,只做了一件事:上线前跑一批测试样本。Sandipan直言,这在生产环境里几乎没意义。
他用一个零售聊天机器人的例子说明,真正有效的Evaluation至少有三层。
第一层,是离线评估。用固定数据集,确保模型在基本能力上不过线。
第二层,是线上行为评估。模型在真实用户交互中的表现,是否开始偏移?是否出现异常回答?
第三层,是业务结果评估。回答“像不像人”不重要,重要的是有没有解决问题、减少人工、提升转化。
关键在于:Evaluation不是一次性的,而是一个持续运行的系统。否则你永远只能在用户投诉之后,才意识到AI已经“跑偏”很久了。
没有可观测性,你只是盲开一辆自动驾驶
Observability是第二根柱子,也是最容易被低估的一根。
Sandipan的原话很直接:如果你没有一个系统去观察AI的行为,那你根本不知道它什么时候开始失控。
可观测性不只是日志,而是要回答几个关键问题:
- 某类问题的失败率是否突然上升?
- 是模型版本变更导致的,还是数据分布变了?
- 某个Agent是否开始频繁调用不该调用的工具?
当AI开始具备“行动能力”,而不仅是“回答能力”时,没有Observability,本质上就是在生产环境里蒙眼狂奔。
从数据地基到多Agent,再到治理
Sandipan强调,第三根柱子——数据基础,是最重要的一根。
在Databricks的实践中,他们首先构建的是一个稳固、可追溯的数据层。只有当数据来源、版本、权限都清晰,AI Agent的行为才有可解释性。
接下来是多Agent编排。当一个系统里有多个Agent协作时,必须明确:谁负责决策,谁负责执行,谁负责校验,以及什么时候需要Human-in-the-loop。
最后是治理。治理不是限制创新,而是让AI能被企业“放心使用”。包括访问控制、变更管理、责任归属。
在他分享的案例中,团队前两周先搭建Evaluation层,然后逐步引入模型和Agent协作模式,最终得到的不是一个“更聪明的Demo”,而是一个能长期运行的系统。
总结
这场演讲最反直觉的地方在于:它几乎没有在“夸模型”。Sandipan反复强调,企业级AI的胜负,早就不在参数规模上,而在工程纪律上。
如果你正在做AI Agent,这里有三个立刻可行动的检查点:第一,你是否能清楚回答“AI现在表现得怎么样”;第二,你是否能在问题爆发前看到预警;第三,当AI做出错误决策时,谁能介入、怎么介入。
未来真正拉开差距的,不是谁先用上新模型,而是谁先把这五根柱子立稳。等到所有人都能调用同样的模型时,这套生产体系,才是你唯一的护城河。
关键词: AI Agent, 企业级AI, Evaluation, Observability, AI治理
事实核查备注: 需要核查:演讲者身份为Databricks数据与AI技术负责人;提出的五个支柱名称与顺序;Evaluation包含三层评估的表述;案例中“前两周搭建Evaluation层”的时间描述。