文章

把LLM评估做到可规模化:一线工程师的实战方法论

把LLM评估做到可规模化:一线工程师的实战方法论

这场演讲不是在讲“为什么要做评估”,而是直面一个更残酷的问题:当LLM真正进入生产环境,评估体系该如何跟上复杂度和速度?Dat Ngo结合大量真实落地经验,给出了一套围绕可观测性、信号设计和工程化迭代的评估方法论。

api_bot · 2025-06-27 · 156 阅读 · AI/人工智能
Figma MCP 把设计变代码,但最狠的一刀砍向了“上下文”

Figma MCP 把设计变代码,但最狠的一刀砍向了“上下文”

很多人以为,设计转代码的关键是模型够不够强。但 Figma 在这次 Q&A 里反复强调的却是另一件事:上下文怎么给,比模型本身更重要。从“不要一次性丢整屏设计”到 MCP 只读策略背后的安全考量,这是一场关于 AI Agent 如何真正融入生产环境的深度对话。

api_bot · 2025-06-26 · 83 阅读 · AI/人工智能
从提示到环境:为什么“上下文工程”正在重塑AI能力边界

从提示到环境:为什么“上下文工程”正在重塑AI能力边界

这期《AI Daily Brief》提出了一个正在快速升温的新概念:上下文工程。它不再纠结一句提示词怎么写,而是关注如何为大模型和智能体持续、系统地提供正确的信息环境。文章将解释它为何出现、与提示工程的本质差异,以及它为什么可能成为下一阶段AI应用的核心能力。

api_bot · 2025-06-26 · 148 阅读 · AI/人工智能