📋 编辑总结
无问芯穹联合清华、上交开源的具身智能端侧推理引擎:Pi 0.5 性能 SOTA,瞄准具身智能规模化落地『最后一公里』,让机器人推理从云端下沉到端侧设备,量子位/机器之心双源报道。 定价:开源免费(Apache 2.0)。编辑评分:⭐ 4.5。

APXInf 是无问芯穹(Infinigence)联合清华大学、上海交通大学开源的具身智能端侧推理引擎,专攻机器人推理从云端下沉到端侧的『最后一公里』,在 Jetson Thor 上把 Pi 0.5 的端到端推理延迟压缩到了原来的十分之一左右。

APXInf 是什么?

APXInf 于 2026 年 9 月 15 日开源(Apache 2.0 许可),代码仓库为 github.com/RLinf/APXinf-robo。它面向具身智能(机器人)场景,用极简的 Rust 运行时在边缘设备上高效执行 VLA(视觉-语言-动作)类模型,解决真实机器人部署中云端推理延迟高、依赖网络不可靠的问题,量子位、机器之心等行业媒体均有报道。对机器人团队而言,这一步的意义在于:当推理不再依赖网络与云端排队,机器人动作控制的实时性和确定性就有了保障,规模化部署的成本结构也随之改变。

核心功能

  • 极简 Rust 运行时:以 Rust 实现的轻量推理引擎,资源占用低、行为确定性强,适合嵌入机器人本体控制系统。
  • 端侧 FP8 推理:在 NVIDIA Jetson Thor 上对 Pi 0.5 模型做 FP8 量化推理,端到端延迟从 278ms 压到 26ms 以内,约 10.7 倍加速,控制闭环可以完全在设备本机完成。
  • VLA 模型适配:针对具身智能主流的 Pi 0.5 类视觉-语言-动作模型专门优化,机器人『感知-决策-动作』的完整闭环可在本机完成。
  • 云到端下沉:把原本依赖云端 GPU 的推理搬到机器人自带的边缘算力上,降低网络依赖与延迟抖动,弱网环境也能稳定工作。
  • 开源可复现:Apache 2.0 许可,代码与部署方法公开,方便研究团队复现与二次开发。

版本/套餐对比

APXInf 完全开源免费,采用 Apache 2.0 许可,无商业授权门槛,也无云服务费用;作为研究导向的开源项目,使用、复现与二次开发遵循 Apache 2.0 条款即可。运行成本主要在硬件——官方演示基于 NVIDIA Jetson Thor 等边缘计算设备,其他硬件平台的支持情况以仓库文档为准。作为 2026 年 9 月刚开源的项目,版本迭代较快,集成时建议以 GitHub Release 为准。

值不值得用?

优点非常突出:约 10.7 倍的端到端延迟压缩直接改变了机器人部署的可行性——26ms 以内的推理延迟意味着动作控制可以完全在端侧闭环,不再受网络与云端排队制约;Rust 极简运行时对嵌入式场景友好;Apache 2.0 许可商用无忧;背后有无问芯穹与两所高校的工程背书。缺点是项目刚开源,目前公开验证的是 Pi 0.5 这一类模型的适配,其他 VLA 模型需要自行移植;Jetson Thor 等目标硬件价格不低,个人玩家门槛高;社区生态与文档还需要时间积累。另外,具身智能整体仍处早期,端侧推理只是其中一环,感知、训练与数据闭环的配套成熟度同样影响最终效果。结论:做具身智能、机器人研发的工程团队值得第一时间跟进;纯软件开发者或没有边缘硬件的用户暂时用不上。

使用建议

  • 先对齐硬件清单:确认手头或采购计划中的边缘设备(如 Jetson Thor)是否在支持列表,再评估移植与采购成本。
  • 从 Pi 0.5 复现起步:官方已验证的路径最稳,先跑通官方基准确认延迟数字,再谈接入自己的模型。
  • 关注延迟数字的真实条件:26ms 是特定模型、特定量化与特定硬件下的结果,自己的场景务必实测。
  • 跟踪仓库更新:新开源项目接口变动频繁,建议锁定 Release 版本集成,避免被主分支的破坏性改动拖累。

适合谁用?

推荐:具身智能、机器人方向的研究与工程团队,以及需要在端侧跑 VLA 模型的开发者。 可考虑:关注边缘 AI 推理优化、想学习 Rust 推理引擎实现的技术团队。 不推荐:没有边缘硬件、不做机器人或具身智能场景的普通应用开发者。