做 LLM 的人都会踩的坑:Dat Ngo 说真正难的不是模型,而是这三件事
如果你还在为“该用哪个大模型”纠结,那你已经落后了。Arize AI 的 Dat Ngo 直言:当 LLM 进入生产环境,真正决定成败的不是模型能力,而是你有没有把可观测、评估和实验这三件事做对。这场分享,把行业最容易忽略、却最致命的问题摊在了桌面上。
如果你还在为“该用哪个大模型”纠结,那你已经落后了。Arize AI 的 Dat Ngo 直言:当 LLM 进入生产环境,真正决定成败的不是模型能力,而是你有没有把可观测、评估和实验这三件事做对。这场分享,把行业最容易忽略、却最致命的问题摊在了桌面上。
如果我告诉你,一个可用的 LLM 推理 API,从零到上线,不到 5 分钟,你大概会以为这是营销话术。但在这场来自 RunPod 的现场演示里,这件事真的发生了。更重要的不是“快”,而是它背后暴露的一个行业转向:AI 开发者,正在彻底告别基础设施焦虑。
如果你还在为写爬虫、改 selector、半夜被反爬打醒,那你已经落后一个范式了。Rafael Levi 在这场分享里抛出一个反直觉观点:真正能规模化的数据管道,不是写出来的,而是“长出来的”。AI Agent 正在把最脏最累的工作自动化。
如果你还在逐行 review 代码,AI 时代你可能正在拖慢整个团队。这期 Peter Yang 的访谈里,一位前 Meta L8 工程师公开了他用 AI Agent 把自己“移出开发回路”,实现一天 40 个 PR 的真实工作流,信息量极高,也极具争议。
当所有人都在谈模型、算力和自动化时,iPod 与 iPhone 之父却在这期播客里泼了盆冷水:真正决定产品生死的,仍然是人的品味、判断和责任感。更反直觉的是,他认为 AI 越强,人类反而越不能“放手”。
这一周的AI圈有点不对劲:Cursor不再只是写代码的工具,DeepSeek被反复拿来和Opus对标,而Anthropic似乎成了最“坐立不安”的那一方。这不是零散更新,而是一条正在成形的趋势线。
大多数人以为,AI 编程助手的天花板就是“更会写代码”。但在这场 GitHub 的分享里,Microsoft 和 GitHub 直接掀桌子:未来的 Copilot,不是多聪明,而是能不能在聊天里直接跑 UI、画火焰图、让你点着用。这正是 MCP Apps 想解决的事。
Hermes Desktop 刚发布时,很多人以为它只是又一个“更好看的 AI 客户端”。但 Greg Isenberg 的这期视频,直接把问题抛到台面上:如果你用对了 Hermes Agent,它不是效率工具,而是一个 24 小时为你工作的系统。这篇文章,讲清楚为什么。
如果你以为评测(Evals)能客观告诉你模型好坏,这场演讲会让你不太舒服。Ara Khan 直接抛出结论:Evals 本身是“坏的”,但你不仅不能扔,还必须继续用——只是用法完全不是你想的那样。
如果让 AI Agent 真正走向商业世界,它们迟早要自己下单、付款、结算。但 Stripe 的 Steve Kaliski 在这场演讲里抛出一个反直觉的结论:问题不在于“机器人能不能付钱”,而在于“我们有没有把支付基础设施拆对”。这是一篇每个做 Agent、平台和工具的人都该读完的文章。