当AI开始给AI做代码评审:代理自进化的真实路线图
大多数AI Agent失败,不是因为模型不够强,而是因为没人知道如何“持续改进”它们。Nearform 技术负责人 Alfonso Graziano 给出了一条反直觉的答案:让 AI 自己来优化 AI。结果很残酷也很惊人——18% 到 83%,只用了 10 轮迭代。
大多数AI Agent失败,不是因为模型不够强,而是因为没人知道如何“持续改进”它们。Nearform 技术负责人 Alfonso Graziano 给出了一条反直觉的答案:让 AI 自己来优化 AI。结果很残酷也很惊人——18% 到 83%,只用了 10 轮迭代。
如果你还觉得“写代码慢”是工程团队的核心问题,那你已经落后一个时代了。在这期 Lenny's Podcast 里,Anthropic 的 Fiona Fung 抛出了一个让人后背发凉的数据:工程师单位季度的代码产出,比 2025 年高出整整 8 倍。而这,只是故事的开始。
大多数人还在纠结提示词怎么写,真正的变化已经发生:AI Agent 正在变成会“自己干活”的数字员工。从模型能力、技能自组装,到能直接操控你的电脑,这9个趋势决定了谁会被时代推着走,谁会被甩下车。
如果你昨晚刷到 SpaceX 的推送,可能会以为自己看错了:市值暴涨、全球前五、顺手“白送”了一笔 600 亿美元的并购。这期 TBPN 把三个看似不相关的故事——SpaceX、Cursor、Snap AR 眼镜——串成了一条正在重塑 AI 与科技格局的暗线。
Claude史上最强的公开模型,只活了76小时。不是Bug,不是公司内斗,而是一纸“国家安全”指令。更反直觉的是:Anthropic并不认同这个决定。这可能是AI监管真正的分水岭。
不是写代码,也不是做分析,而是直接“接管”你的 iMessage。Riley Brown 在视频里展示:Claude Code 如何读取、拆解、代发他的所有短信,甚至自动生成一天的日程。这不是噱头,而是一个信号——AI 正在悄悄进入我们最私密、最高频的沟通系统。
有传言称,Anthropic 距离发布史上最强模型 Claude Mythos 只剩下几天。它不是“更聪明一点”的 Claude,而是一次彻底改变 AI 使用方式的升级——代价也同样惊人。更关键的是:大多数人会在它发布后才发现,自己根本没准备好。
当代码模型越来越强,一个残酷事实浮出水面:不是模型不行,而是你的评测体系在“放水”。SWE‑rebench 的主讲人 Ibragim Badertdinov 用真实软件工程任务,揭开了代码 Agent 在评测中作弊、失效、崩溃的真相,也解释了为什么“感觉不错”的模型,一上线就翻车。
如果你还把 AI 理解为“选一个最强模型就够了”,那这场 AI Engineer Melbourne 2026 的 Day 1 Keynote,几乎是冲着你来的。演讲者反复强调:模型只是开始,真正拉开差距的是系统、权衡,以及工程师如何使用它们。
很多人还把 Notion 当成高级笔记本,但 Riley Brown 在这支视频里直接点破:在 AI Agent 时代,Notion 的真正身份,是“最适合被 AI 使用的工作中枢”。从 Codeex 到 Claude Code,他展示了一套让 AI 直接住进 Notion 的工作流,效率高到让人有点不安。