评估不是最后一步:Cedric Vidal谈AI Agent走向可靠性的关键路径
在这场由微软首席AI布道师Cedric Vidal带来的分享中,评估被重新定义为AI Agent开发的起点而非终点。通过手动评估、Spot Check到代码化和多模态评估的逐步演示,他展示了一条让Agent真正可控、可扩展的实践路径。
在这场由微软首席AI布道师Cedric Vidal带来的分享中,评估被重新定义为AI Agent开发的起点而非终点。通过手动评估、Spot Check到代码化和多模态评估的逐步演示,他展示了一条让Agent真正可控、可扩展的实践路径。
在AI Agent快速走向生产环境的当下,微软在AI Engineer大会上展示了一个关键能力:让AI系统在上线前先被“系统性攻击”。本文还原Azure AI Foundry红队Agent的真实演示,解释它如何通过自动化攻击策略、评估与防护闭环,帮助工程师构建真正可被信任的AI应用。
当云端AI仍在狂飙,微软却在系统性推进“本地AI”。在这场演讲中,Foundry Local首次完整展示了微软对边缘AI的判断、技术积累与真实落地方式,解释了为什么现在正是本地AI成熟的关键节点。
LlamaIndex 开发者关系副总裁 Laurie Voss 用 15 分钟浓缩了一个关键信息:真正能在生产中跑起来的 Agent,靠的不是“更聪明的模型”,而是扎实的设计模式。这场演讲从 RAG 的必要性讲起,逐步引出链式、路由和编排式等 Agent 架构,给出了一套可复用的方法论。
在这场演讲中,Jim Bennett用一连串真实翻车案例和现场演示,解释了为什么AI代理天生不值得“信任”,以及如何通过“以评估为核心、以可观测性为驱动”的方法,把不可预测的AI系统驯服成可控的软件系统。
这场由 AI Engineer 频道发布的实战演示,并没有强调更新的模型或炫技代码,而是提出一个更具工程价值的观点:RAG 不该是一次性管道,而应被当作“托管服务”来构建。通过现场一步步搭建 Agent、接入数据、做评估,演讲者展示了如何把 RAG 从 Demo 推向可生产化系统。
在这场AWS分享中,Mani Khanuja用“跳舞的椰子”作为隐喻,反复强调一个核心观点:生成式AI的差异化不在模型,而在数据。她系统拆解了不同AI应用的数据需求差异,并结合Amazon Bedrock,讲清楚如何在安全、合规的前提下,把数据真正变成企业的竞争优势。
AWS 的 Suman Debnath 在这场演示中介绍了 Strands Agents——一个刻意“反工程化”的开源 AI Agent SDK。它试图用极少的 scaffolding,把推理权真正交还给模型,并通过真实 Demo 展示:当你只保留模型与工具,Agent 反而能做得更多。
这是一次少见的、从代码细节出发讨论“生产级 AI Agent”的分享。AWS 开发者布道师 Mike Chambers 用一个极简 Demo,拆解了 AI Agent 的最小可行结构,并解释了为什么真正的难点不在模型,而在工程化与系统设计。
这场对话罕见地从第一性原理出发,拆解了“语音AI为什么难以规模化”的核心原因。Cartesia联合创始人Arjun Desai与AWS的Rohit Talluri分享了他们在实时语音、低延迟推理和新模型架构上的关键判断,揭示了企业级语音AI真正的技术门槛。