OpenAI都在提醒:AI系统成败不在代码,而在设计
正在加载视频...
视频章节
当所有人沉迷于“让AI写代码、马上上线”,MongoDB的Apoorva Joshi却抛出一个反直觉结论:真正决定AI系统成败的,已经不是代码,而是你在动手前的系统设计。这场演讲,用一个真实的医保理赔案例,把AI从想法走向生产的底层逻辑彻底讲透。
OpenAI都在提醒:AI系统成败不在代码,而在设计
当所有人沉迷于“让AI写代码、马上上线”,MongoDB的Apoorva Joshi却抛出一个反直觉结论:真正决定AI系统成败的,已经不是代码,而是你在动手前的系统设计。这场演讲,用一个真实的医保理赔案例,把AI从想法走向生产的底层逻辑彻底讲透。
最危险的错觉:AI写代码这么强,还需要设计吗
Apoorva一上来就戳破了当下AI圈最流行、也最危险的幻觉:既然大模型已经这么会写代码了,是不是“vibe coding、直接上线”就够了?
她的答案是否定的,而且语气非常重。问题不在于AI写得好不好,而在于——当你在做一个“有人依赖、会产生真实后果”的系统时,凭感觉写代码,本身就是风险源。更耐人寻味的是,这个判断并非保守派的杞人忧天,连Anthropic和OpenAI自己都在公开场合反复强调:“Specs are the new code。”
也就是说,在AI时代,真正的技术壁垒不再是敲代码的速度,而是你能不能把产品需求、系统边界、评估标准定义清楚。代码可以让模型生成,但“要生成什么样的系统”,这件事只能靠人类的判断力。
一个四阶段框架,专治“做着做着就失控”的AI项目
为了解决这个问题,Apoorva给出了一套极其克制、却异常实用的四阶段框架:产品需求、系统设计、评估与监控、成本与可靠性优化。
第一步不是选模型,而是把业务问题说清楚:给谁用、现在有多痛、如果不解决会发生什么。她特别强调“量化”,因为AI系统如果没有量化目标,最后一定会变成“看起来挺聪明,但没人敢用”。
接着是系统设计:数据从哪来、架构怎么走、用什么模式才能满足前面定义的约束。然后是评估和监控——在上线前,你如何确认它真的有效;上线后,又如何发现它正在悄悄变坏。最后一步才是很多团队最关心的:在真实生产环境里,如何在准确率、成本、延迟和稳定性之间做取舍。
这四步看起来朴素,但它的真正价值在于:强迫你在“写第一行代码之前”,就把失败路径想清楚。
医保理赔案例:AI不是裁判,而是加速器
为了避免框架流于空谈,Apoorva选了一个极其现实的场景:医保理赔审核。这个流程长期依赖人工,审核员要在临床指南、保险条款和患者历史之间来回切换,效率低到离谱。
她给出的业务问题非常具体:某医疗机构的审核员平均需要2天处理一单理赔,是行业标准的4到12倍,直接拖慢患者治疗。这一刻,AI的角色就变得清晰了——不是替代人类做最终裁决,而是压缩信息检索和理解的时间。
这也直接影响了后续的所有设计决策:系统必须支持人类审核介入,任何拒赔都要人工复核;患者数据不能离开指定云环境;模型选择受合规限制。AI在这里是“辅助决策系统”,而不是全自动裁判。这种对AI自主程度的克制,反而让系统更容易落地。
RAG不是潮流,而是被现实逼出来的选择
在系统层面,这个案例几乎自然地走向了一个组合:RAG + 受控流程 + Human-in-the-loop。不是因为RAG时髦,而是因为数据形态决定了它最合适。
临床指南和保险条款是PDF,需要切分、Embedding、加元数据;患者历史在MongoDB里,适合精确查询。于是,向量检索负责“找对知识”,结构化查询负责“拿到事实”,大模型只做一件事:在受控上下文中生成带理由的建议。
更重要的是,Apoorva反复强调“从最简单的架构开始”。先画清楚一单理赔在系统里的流转路径,找到断点,再决定是否需要代理、路由、微调。很多AI系统之所以复杂到不可维护,往往不是需求复杂,而是一开始就高估了AI该承担的角色。
上线不是终点:评估、成本和可靠性才是生死线
在评估与监控部分,她给出了一个很多团队忽略的视角:评估是上线前的事,监控是上线后的事,但两者必须从第一天就一起设计。
由于大模型本质是概率系统,Guardrails不是锦上添花,而是基础设施。无论是非法输入、无效输出,还是业务指标(比如理赔处理时长),都必须被持续度量。到了生产环境,还要额外盯住人工覆盖率、复审耗时——这些都是用户不信任系统的早期信号。
当系统跑起来之后,优化的重点也会变化:准确率往往取决于你往上下文窗口里塞了什么;成本和延迟则可以通过语义缓存、批处理来压;而可靠性,最终要靠结构化输出和可追溯引用来兜底。
总结
这场演讲最有价值的地方,并不在于介绍了多少新技术,而在于它重新校准了AI工程的重心:先想清楚你在解决什么问题,再决定AI该做多少事。对从业者来说,最直接的行动建议只有三条:在写代码前,把业务目标量化;用约束而不是想象来设计架构;把评估和监控当成产品的一部分,而不是事后补丁。未来真正拉开差距的,不是谁的模型更新,而是谁的系统更值得被信任。
关键词: AI系统设计, RAG, 大语言模型, AI产品落地, Human-in-the-loop
事实核查备注: 需要核查:Apoorva Joshi的姓名拼写;其在MongoDB的职位描述;“Specs are the new code”为Anthropic/OpenAI演讲中的原话表述;医保理赔案例中的2天、4倍、12倍数据是否为假设示例。