
清华 + 无问芯穹(Infinigence)+ 上海交通大学 2026-09-15 开源:一个用 Rust 写、零外部依赖、专为具身智能体设计的端侧推理引擎。首发即带高度优化的 PI-0.5 VLA 模型上 Jetson Thor / Orin,BF16/FP8/INT8 三种精度。机器人本体跑大模型提速 10.7 倍——本文把官方 README 里的全部硬数据拆给你。
基本档案(GitHub API 实测 2026-10-04)
| 项目 | 值 |
|---|---|
| 主仓库 | infinigence/ApxInf(无问芯穹官方组织) |
| 配套仓库 | RLinf/APXinf-robo(桥接具身模拟器/基准/物理本体) |
| 星标 | 78(ApxInf)/ 183(APXinf-robo) |
| 许可 | Apache-2.0(双仓库) |
| 创建 | 2026-08-13 / 2026-09-07 |
| 最近推送 | 2026-09-30 / 2026-09-29 |
| 技术栈 | Rust,零外部依赖 |
官方定位(README 原文):"ApxInf is a reimagined edge inference engine born of the agentic coding era, combining high performance, reliability, and energy efficiency across devices with an evolving agentic workflow that radically simplifies custom model development."
三条设计优先级,直接写在 README 里:
- 系统语言 Rust,零外部依赖——嵌入式场景的硬性要求,C++ 生态的依赖地狱在 Jetson 上会要命
- 具身智能第一优先:VLA/WAM 模型上 Jetson / DriveOS Thor / Orin
- Agent 化的 CUDA Kernel 优化——用 Agent 自动优化内核,这是它"born of the agentic coding era"的实际含义
首发能力:PI-0.5 VLA 上 Jetson
V1 的核心卖点是高度优化的 PI-0.5 VLA 模型,直接跑在 Jetson Thor 和 Orin 上,支持 BF16 / FP8 / INT8 三种精度。
官方基准流程(README 原文命令):
python scripts/bench_pi05.py --random-weights --model-variant bf16 \
--layer l1 --views 2 --token-count 10 --action-horizon 10 \
--num-flow-steps 10 --warmup 10 --samples 30 --autotune- 报告值:P50 延迟,10 次 warm-up 后采样 30 次
- 随机权重 + 合成输入测的是运行时与延迟(runtime/latency)
- 任务成功率要走 LIBERO 评测(README 明确区分这两件事)
Python API(README 原文):
from apxinf import AutoPolicy
policy = AutoPolicy.from_pretrained("<path-to-model>", model_variant="bf16")
result = policy.infer(observation)
result["actions"] # (H, policy.action_dim) float32, 未归一化
result["timing"] # model_ms / total_ms返回里直接带 model_ms / total_ms 计时——引擎把性能测量做进 API 是端侧框架的成熟标志。
具身桥接:APXinf-robo
RLinf/APXinf-robo 的定位是把 ApxInf 接到具身模拟器、基准和物理本体上,ApxInf 本体以 git submodule(apxinf/)形式内嵌。
Python API 差异(对比主仓库):
from apxinf_robo import build_robot_policy
policy = build_robot_policy("franka_libero", "<path-to-model>", precision="bf16")
# observation 支持 image_keys / prompt_key / state_key 三种 metadata 驱动franka_libero 这个 preset 直接点名——Franka 机械臂 + LIBERO 基准,做具身验证不用自己搭环境。
为什么这事重要(对比本站已有内容)
本站已有的端侧/多设备文章都围绕桌面 GPU:5090 单卡 1M 上下文、7900XTX 当 7x24 API 服务器、backburner 用 iPhone 帮 Mac 跑 27B。APXInf 把端侧这条线推到机器人本体:
| 维度 | 桌面 GPU 方案(本站已覆盖) | APXInf |
|---|---|---|
| 载体 | 5090 / 7900XTX / Mac | Jetson Thor / Orin / DriveOS Thor |
| 模型 | 通用 LLM(27B~125B) | VLA/WAM(PI-0.5) |
| 场景 | 聊天/编程/API | 具身控制(动作序列输出) |
| 精度 | FP8/INT4 | BF16/FP8/INT8 |
| 输出 | token | (H, action_dim) 动作 + 计时 |
10.7 倍提速这个数字来自官方新闻口径(9/15 发布,新浪财经 9/29 报道),指机器人本体上相对此前端侧推理方案的提速。仓库星数还很低(78/183),但 Apache-2.0 + 三机构背书 + Rust 零依赖,是具身端侧推理里目前规格最完整的一个。
适用 / 不适合
适合:在 Jetson Thor/Orin 上跑 VLA 模型、要 INT8/FP8 端侧量化、要 Rust 无依赖的嵌入式栈、做具身机器人推理链路。
不适合:要通用 LLM 端侧推理(它是 VLA/WAM 优先,通用 LLM 不是首发目标);要 NVIDIA 桌面卡推理(目标平台是 Jetson 系)。
结论
端侧推理过去两年的主角是"LLM 跑小设备",APXInf 把主角换成了VLA 模型跑机器人本体——这是具身智能落地的真实瓶颈位置。Rust 零依赖 + 官方优化 PI-0.5 + LIBERO/Franka 桥接 + API 内置计时,是目前这条赛道上工程完整度最高的开源方案。星数会涨,发布才 5 周。
仓库:github.com/infinigence/ApxInf + github.com/RLinf/APXinf-robo | 许可:Apache-2.0 | 数据:官方 README + GitHub API(2026-10-04 实测)