# JEV-Ultrafast：桌面 Agent 提速 10 倍

> 同一个 computer-use 任务，改前 271 秒改后 27 秒，差 9.9 倍。核心是读结构化 DOM（46ms）而不是看截图，决策简化成一次 TypeSafe Choice。

![JEV-Ultrafast DOM 决策链路示意](/assets/articles/lcz/jev/hero.jpg)

> 同一个 computer-use 任务（打开 NBA 官网，逐屏翻阅新闻），改前 271 秒，改后 27 秒——差 9.9 倍。

## 问题：computer-use 的"老年手速"

让 AI agent 操作桌面（computer-use），传统链路是：**全屏截图 → 送多模态模型 → 模型看图后输出一段话 → 解析出动作**。每一步都是"看一张图然后说话"，慢且贵。

实测改前：13 次工具调用，每次 19.4 秒，总耗时 271 秒。

## JEV-Ultrafast 的思路

**读结构化 DOM，而不是看截图。** 浏览器里的 DOM 树本身就是结构化的——每个元素有标签、属性、位置，不需要"看图猜"。

新链路：
- 读屏：读结构化 DOM，**46ms**（对比截图送模型要几秒）
- 决策：TypeSafe 一次 Choice，**约 1 秒**（对比模型看图输出再解析）

## 实测数据

| 指标 | 改前 | 改后 |
| --- | --- | --- |
| 总耗时 | 271.4s | 27.41s |
| 交互轮次 | 13 次工具调用 | 8 步 |
| 平均每步 | 19.4s | 3.08s |
| 读屏方式 | 全屏截图送多模态模型 | 读结构化 DOM，46ms |
| 决策方式 | 模型看图后输出一段话 | TypeSafe 一次 Choice，约 1s |

鼠标全程在屏幕上真的动（滚动、点击），1 倍速录屏无剪辑。

## 为什么快 10 倍

核心是**省掉了"看图"这个环节**。截图 → 多模态模型 → 文本输出 → 解析，这条链路每一步都要等模型算完。换成读 DOM，浏览器直接给你结构化数据，46ms 就拿到，决策也简化成一次 API 调用。

## 适合谁

- 用 computer-use 插件做桌面自动化
- 嫌 agent 操作桌面慢
- 高负荷 computer-use 应用需要省 token


---
来源：https://laobanclaw.top/articles/jev-ultrafast-10x-desktop-agent/（AI 军火库）
