
同一个 computer-use 任务(打开 NBA 官网,逐屏翻阅新闻),改前 271 秒,改后 27 秒——差 9.9 倍。
问题:computer-use 的"老年手速"
让 AI agent 操作桌面(computer-use),传统链路是:全屏截图 → 送多模态模型 → 模型看图后输出一段话 → 解析出动作。每一步都是"看一张图然后说话",慢且贵。
实测改前:13 次工具调用,每次 19.4 秒,总耗时 271 秒。
JEV-Ultrafast 的思路
读结构化 DOM,而不是看截图。 浏览器里的 DOM 树本身就是结构化的——每个元素有标签、属性、位置,不需要"看图猜"。
新链路:
- 读屏:读结构化 DOM,46ms(对比截图送模型要几秒)
- 决策:TypeSafe 一次 Choice,约 1 秒(对比模型看图输出再解析)
实测数据
| 指标 | 改前 | 改后 |
|---|---|---|
| 总耗时 | 271.4s | 27.41s |
| 交互轮次 | 13 次工具调用 | 8 步 |
| 平均每步 | 19.4s | 3.08s |
| 读屏方式 | 全屏截图送多模态模型 | 读结构化 DOM,46ms |
| 决策方式 | 模型看图后输出一段话 | TypeSafe 一次 Choice,约 1s |
鼠标全程在屏幕上真的动(滚动、点击),1 倍速录屏无剪辑。
为什么快 10 倍
核心是省掉了"看图"这个环节。截图 → 多模态模型 → 文本输出 → 解析,这条链路每一步都要等模型算完。换成读 DOM,浏览器直接给你结构化数据,46ms 就拿到,决策也简化成一次 API 调用。
适合谁
- 用 computer-use 插件做桌面自动化
- 嫌 agent 操作桌面慢
- 高负荷 computer-use 应用需要省 token