Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
NEWS HN 286 约 1 分钟

一万七千次运行,看Agent选什么工具

近1.7万次真实代码实验显示,提问方式也会改变编程Agent的工具选择。

IMAGE — Hacker News 高分帖(24h+ 滚动窗口)

让编程AI替你接入邮件、存储或监控服务,它会选哪一家?这不只是模型的“个人口味”:工具名称、参数和返回结果是否容易被机器理解,也会影响它能否把任务做完。Armature 因此没有比较答题分数,而是观察 Claude、Codex 和 Cursor 在真实代码仓库里主动选择什么工具。

团队构造了75个代码仓库,覆盖10种语言,并设计1163种任务变体,再用不同身份的提问方式模拟真实需求。最值得注意的是,实验加入了一个由 Gemini 3.7 Flash 扮演的“模拟人类”:Agent先分析并推荐方案,再获得确认后实施。作者发现,这一步会减少头部厂商和云平台自带方案的优势。例如在对象存储任务中,允许来回确认后,Cloudflare R2开始赢下一些原本总由 Amazon S3胜出的会话。换句话说,Agent选什么,不只取决于工具本身,也取决于它有没有机会先问清楚。

实验共运行16893次,但目前只公布了其中5292个有效会话,覆盖51个代码库和18个领域;其余结果尚未披露。因此,这批数据更适合帮助开发者检查“工具怎样写才方便Agent发现和调用”,还不能当作完整的产品排行榜。


供稿材料 SOURCES — 1

← 返回 2026-09-05 · 科技板块