# APXInf 端侧推理引擎：Rust 零依赖，机器人本体跑 VLA 提速 10.7 倍

> 清华 + 无问芯穹 + 上交 9/15 开源：官方 README 全部硬数据拆解，PI-0.5 上 Jetson Thor/Orin，BF16/FP8/INT8

![APXInf 端侧推理引擎](/assets/articles/lcz/apxinf-edge-inference-jetson-thor/hero.jpg)

> 清华 + 无问芯穹（Infinigence）+ 上海交通大学 2026-09-15 开源：一个用 Rust 写、零外部依赖、专为具身智能体设计的端侧推理引擎。首发即带高度优化的 PI-0.5 VLA 模型上 Jetson Thor / Orin，BF16/FP8/INT8 三种精度。机器人本体跑大模型提速 10.7 倍——本文把官方 README 里的全部硬数据拆给你。

## 基本档案（GitHub API 实测 2026-10-04）

| 项目 | 值 |
| --- | --- |
| 主仓库 | `infinigence/ApxInf`（无问芯穹官方组织） |
| 配套仓库 | `RLinf/APXinf-robo`（桥接具身模拟器/基准/物理本体） |
| 星标 | 78（ApxInf）/ 183（APXinf-robo） |
| 许可 | Apache-2.0（双仓库） |
| 创建 | 2026-08-13 / 2026-09-07 |
| 最近推送 | 2026-09-30 / 2026-09-29 |
| 技术栈 | Rust，零外部依赖 |

**官方定位**（README 原文）：*"ApxInf is a reimagined edge inference engine born of the agentic coding era, combining high performance, reliability, and energy efficiency across devices with an evolving agentic workflow that radically simplifies custom model development."*

三条设计优先级，直接写在 README 里：

1. **系统语言 Rust，零外部依赖**——嵌入式场景的硬性要求，C++ 生态的依赖地狱在 Jetson 上会要命
2. **具身智能第一优先**：VLA/WAM 模型上 Jetson / DriveOS Thor / Orin
3. **Agent 化的 CUDA Kernel 优化**——用 Agent 自动优化内核，这是它"born of the agentic coding era"的实际含义

## 首发能力：PI-0.5 VLA 上 Jetson

V1 的核心卖点是**高度优化的 PI-0.5 VLA 模型**，直接跑在 Jetson Thor 和 Orin 上，支持 BF16 / FP8 / INT8 三种精度。

官方基准流程（README 原文命令）：

```bash
python scripts/bench_pi05.py --random-weights --model-variant bf16 \
  --layer l1 --views 2 --token-count 10 --action-horizon 10 \
  --num-flow-steps 10 --warmup 10 --samples 30 --autotune
```

- 报告值：**P50 延迟**，10 次 warm-up 后采样 30 次
- 随机权重 + 合成输入测的是**运行时与延迟**（runtime/latency）
- 任务成功率要走 **LIBERO 评测**（README 明确区分这两件事）

Python API（README 原文）：

```python
from apxinf import AutoPolicy
policy = AutoPolicy.from_pretrained("<path-to-model>", model_variant="bf16")
result = policy.infer(observation)
result["actions"]   # (H, policy.action_dim) float32, 未归一化
result["timing"]    # model_ms / total_ms
```

返回里直接带 `model_ms / total_ms` 计时——引擎把性能测量做进 API 是端侧框架的成熟标志。

## 具身桥接：APXinf-robo

`RLinf/APXinf-robo` 的定位是把 ApxInf 接到**具身模拟器、基准和物理本体**上，ApxInf 本体以 git submodule（`apxinf/`）形式内嵌。

Python API 差异（对比主仓库）：

```python
from apxinf_robo import build_robot_policy
policy = build_robot_policy("franka_libero", "<path-to-model>", precision="bf16")
# observation 支持 image_keys / prompt_key / state_key 三种 metadata 驱动
```

`franka_libero` 这个 preset 直接点名——Franka 机械臂 + LIBERO 基准，做具身验证不用自己搭环境。

## 为什么这事重要（对比本站已有内容）

本站已有的端侧/多设备文章都围绕**桌面 GPU**：5090 单卡 1M 上下文、7900XTX 当 7x24 API 服务器、backburner 用 iPhone 帮 Mac 跑 27B。APXInf 把端侧这条线推到**机器人本体**：

| 维度 | 桌面 GPU 方案（本站已覆盖） | APXInf |
| --- | --- | --- |
| 载体 | 5090 / 7900XTX / Mac | Jetson Thor / Orin / DriveOS Thor |
| 模型 | 通用 LLM（27B~125B） | VLA/WAM（PI-0.5） |
| 场景 | 聊天/编程/API | 具身控制（动作序列输出） |
| 精度 | FP8/INT4 | BF16/FP8/INT8 |
| 输出 | token | (H, action_dim) 动作 + 计时 |

**10.7 倍提速**这个数字来自官方新闻口径（9/15 发布，新浪财经 9/29 报道），指机器人本体上相对此前端侧推理方案的提速。仓库星数还很低（78/183），但 Apache-2.0 + 三机构背书 + Rust 零依赖，是具身端侧推理里目前规格最完整的一个。

## 适用 / 不适合

**适合**：在 Jetson Thor/Orin 上跑 VLA 模型、要 INT8/FP8 端侧量化、要 Rust 无依赖的嵌入式栈、做具身机器人推理链路。

**不适合**：要通用 LLM 端侧推理（它是 VLA/WAM 优先，通用 LLM 不是首发目标）；要 NVIDIA 桌面卡推理（目标平台是 Jetson 系）。

## 结论

端侧推理过去两年的主角是"LLM 跑小设备"，APXInf 把主角换成了**VLA 模型跑机器人本体**——这是具身智能落地的真实瓶颈位置。Rust 零依赖 + 官方优化 PI-0.5 + LIBERO/Franka 桥接 + API 内置计时，是目前这条赛道上工程完整度最高的开源方案。星数会涨，发布才 5 周。

*仓库：github.com/infinigence/ApxInf + github.com/RLinf/APXinf-robo ｜ 许可：Apache-2.0 ｜ 数据：官方 README + GitHub API（2026-10-04 实测）*


---
来源：https://laobanclaw.top/articles/apxinf-edge-inference-jetson-thor/（AI 军火库）
