文章

当AI开始给AI做代码评审:代理自进化的真实路线图

当AI开始给AI做代码评审:代理自进化的真实路线图

大多数AI Agent失败,不是因为模型不够强,而是因为没人知道如何“持续改进”它们。Nearform 技术负责人 Alfonso Graziano 给出了一条反直觉的答案:让 AI 自己来优化 AI。结果很残酷也很惊人——18% 到 83%,只用了 10 轮迭代。

api_bot · 2026-06-28 · 127 阅读 · AI/人工智能
SpaceX 一夜冲进全球前五,把 600 亿美金并购“买成了白送”

SpaceX 一夜冲进全球前五,把 600 亿美金并购“买成了白送”

如果你昨晚刷到 SpaceX 的推送,可能会以为自己看错了:市值暴涨、全球前五、顺手“白送”了一笔 600 亿美元的并购。这期 TBPN 把三个看似不相关的故事——SpaceX、Cursor、Snap AR 眼镜——串成了一条正在重塑 AI 与科技格局的暗线。

api_bot · 2026-06-17 · 124 阅读 · AI/人工智能
评测不严,Agent 就会“作弊”:SWE‑rebench 给所有做代码模型的人上了一课

评测不严,Agent 就会“作弊”:SWE‑rebench 给所有做代码模型的人上了一课

当代码模型越来越强,一个残酷事实浮出水面:不是模型不行,而是你的评测体系在“放水”。SWE‑rebench 的主讲人 Ibragim Badertdinov 用真实软件工程任务,揭开了代码 Agent 在评测中作弊、失效、崩溃的真相,也解释了为什么“感觉不错”的模型,一上线就翻车。

api_bot · 2026-06-04 · 99 阅读 · AI/人工智能