一个政府ERP团队的豪赌:他们如何把AI Agent真正送进生产环境
正在加载视频...
视频章节
多数公司还在Demo里炫耀AI Agent时,OpenGov已经把它塞进了真实的政府ERP系统,而且还规模化跑了起来。更反直觉的是,他们成功的关键,不是更大的模型,而是一整套工程化、可控、可观测的Agent体系。
一个政府ERP团队的豪赌:他们如何把AI Agent真正送进生产环境
多数公司还在Demo里炫耀AI Agent时,OpenGov已经把它塞进了真实的政府ERP系统,而且还规模化跑了起来。更反直觉的是,他们成功的关键,不是更大的模型,而是一整套工程化、可控、可观测的Agent体系。
最反直觉的结论:Agent难点不在模型,在工程
Gabe de Mesa一上来就把行业最容易误判的一点戳破了:OG Assist能跑在生产环境,几乎不是因为“模型多聪明”,而是因为工程系统够硬。OpenGov做的是政府ERP,容错率极低,Agent一旦“幻觉”或误操作,后果直接落在真实公共部门流程上。
因此他们的核心问题从来不是“能不能回答”,而是“能不能被控制、被理解、被审计”。这也解释了为什么整场分享的关键词不是Prompt,而是agent loop、observability、evals、sandboxing。OG Assist从一开始就被设计成一个“受监管的软件系统”,而不是聊天机器人。
从零到统一助手:OG Assist是怎么长出来的
OG Assist并不是一个独立产品,而是嵌入在OpenGov所有产品套件中的统一助手。它能跨模块访问工具和产品数据,对用户来说是“一个助手”,对内部来说却是多个Agent能力的组合体。
起初,OpenGov专门组建了AI agents团队,从后端开始做能力扩展,很快又延伸到前端:屏幕感知、理解用户当前页面、甚至执行操作。这个扩展路径很重要——他们不是先追求“会不会聊天”,而是“能不能干活”。
这也导致一个工程决策:Agent必须天然理解产品上下文,而不是靠Prompt硬塞。这为后面所有架构选择埋下了伏笔。
押注Effect:一场工程师才敢下的重注
OG Assist真正的分水岭,是团队早期押注了Effect这个TypeScript函数式效果系统。这个选择在当时并不主流,但它带来的收益贯穿了整个Agent生命周期:
- 所有Agent输入输出都有明确schema
- 错误处理不是if/else,而是系统级能力
- tracing、logging、profiling成为“默认能力”
更关键的是,当他们从LangGraph迁移到完全Effect-native的agent loop后,Agent变成了一个可组合、可注入、可并发控制的系统。模型不再是写死的,而是依赖注入;并发和取消是结构化的;每一次工具调用都能被完整追踪。
这一步,让Agent从“脚本”进化成“服务”。
Agent不是黑箱:A2A协议、评测和人类刹车
为了避免前后端各自“猜Agent在想什么”,OpenGov引入了Agent-to-Agent(A2A)协议,作为一种严格契约:Agent能做什么、需要什么、返回什么,都写在agent card和扩展里。这极大减少了对齐成本。
在质量控制上,他们同时走了三条路:
- 用户端的即时反馈(👍/👎)
- 人类可读的Agent决策路径
- CI里跑的自动化eval,用真实completion回放测试
而在高风险操作上,OG Assist会主动暂停,等待人类批准。这不是“退步”,而是一种明确的设计哲学:Agent负责提案,人类保留最终控制权。
再加上代码执行和文件操作都在沙箱里完成,Agent被限制在一个“可犯错但不会出事”的空间内。
真正的生产细节:长上下文、生成式UI与可观测性
当Agent真的被频繁使用,现实问题才开始出现:上下文太长、token爆炸、调试困难。
OpenGov的解法并不炫技,而是务实:通过rolling summaries和记忆召回,保持对话连续性;用Effect的span和trace,把一次Agent运行拆解到每个步骤,找瓶颈像查慢SQL一样。
甚至在UI层,他们也没有固化界面,而是让Agent在运行时生成表单和选项——这让OG Assist能适应大量复杂、非结构化的政府工作流。
最后一个细节很“接地气”:OpenGov自己也在内部大量使用Agent,配合Claude和Cursor,加速读文档、写代码、review PR。这不是营销案例,而是他们验证“Agent是否真的有用”的日常方式。
总结
OG Assist的故事给AI从业者一个清醒的提醒:Agent时代的护城河,不是Prompt技巧,也不是模型参数,而是工程系统。能否观测、评测、回滚、约束,决定了Agent是玩具还是生产力。
如果你正在做Agent产品,可以从三个问题开始:你的Agent有没有清晰的契约?每一次行动能不能被追踪和解释?在最坏情况下,人类能不能一脚踩刹车?
下一波真正跑起来的Agent公司,很可能不是模型最强的,而是工程最“啰嗦”的。
关键词: AI Agent, 生产环境, Effect, 可观测性, 人类在环
事实核查备注: 需要核查:Gabe de Mesa的职务与拼写;OpenGov是否明确定位为政府ERP公司;OG Assist是否为统一嵌入式助手;LangGraph迁移到Effect-native agent loop的描述是否与原视频一致;A2A协议的正式名称与定义。