JEV-Ultrafast DOM 决策链路示意

同一个 computer-use 任务(打开 NBA 官网,逐屏翻阅新闻),改前 271 秒,改后 27 秒——差 9.9 倍。

问题:computer-use 的"老年手速"

让 AI agent 操作桌面(computer-use),传统链路是:全屏截图 → 送多模态模型 → 模型看图后输出一段话 → 解析出动作。每一步都是"看一张图然后说话",慢且贵。

实测改前:13 次工具调用,每次 19.4 秒,总耗时 271 秒。

JEV-Ultrafast 的思路

读结构化 DOM,而不是看截图。 浏览器里的 DOM 树本身就是结构化的——每个元素有标签、属性、位置,不需要"看图猜"。

新链路:

实测数据

指标 改前 改后
总耗时 271.4s 27.41s
交互轮次 13 次工具调用 8 步
平均每步 19.4s 3.08s
读屏方式 全屏截图送多模态模型 读结构化 DOM,46ms
决策方式 模型看图后输出一段话 TypeSafe 一次 Choice,约 1s

鼠标全程在屏幕上真的动(滚动、点击),1 倍速录屏无剪辑。

为什么快 10 倍

核心是省掉了"看图"这个环节。截图 → 多模态模型 → 文本输出 → 解析,这条链路每一步都要等模型算完。换成读 DOM,浏览器直接给你结构化数据,46ms 就拿到,决策也简化成一次 API 调用。

适合谁