具身智能技术正从实验室走向实际应用,但要让机器人真正在物理世界中高效执行任务,仍面临诸多挑战。从环境感知到决策制定,再到动作执行,整个流程必须在极短时间内完成闭环,这对端侧推理系统的性能提出了严苛要求。传统云端推理框架难以满足机器人实时控制的需求,如何在有限算力、功耗和成本约束下实现低延迟、高稳定性的推理成为关键问题。
针对这一瓶颈,无问芯穹联合清华大学、上海交通大学团队开发了具身智能端侧推理引擎APXInf,并正式开源其核心代码。该引擎专为机器人本体设计,支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台,覆盖从模型开发到部署的全链路需求。与云端推理不同,APXInf通过系统性优化,在端侧实现了推理延迟的大幅降低——在Jetson Thor平台上,PI 0.5 FP8模型的端到端延迟从278毫秒压缩至26毫秒以内,推理频率提升至38.46Hz,完全满足机器人多场景实时控制要求。
性能突破的背后是多重技术创新的融合。APXInf采用Pipeline、Graph、Kernel及量化等多层优化策略,针对机器人执行链路进行端到端调优。其独创的Agent4Kernel技术通过算子融合实现极限性能挖掘,同时冗余特性设计确保系统在轻量化运行时仍能保持稳定性。在架构层面,引擎以Rust语言构建极简运行时,利用内存安全特性规避风险,再通过Python接口封装降低开发门槛,实现底层性能与上层易用性的平衡。
稳定性是机器人长期运行的核心保障。APXInf通过创新架构设计解决了端侧推理的“抖动”难题:极简运行时减少资源占用,内存安全机制从源头消除风险,而Python接口则保留了开发者熟悉的调用方式。这种设计使引擎在连续感知、多模块并发等复杂场景下仍能保持可预测性,避免因资源冲突或内存泄漏导致的系统崩溃,为机器人长时间稳定运行提供了技术基础。
面对日益多样化的具身模型和硬件平台,APXInf提出了“敏捷推理”理念。传统引擎往往在性能优化与模型接入效率间难以兼顾,而APXInf通过冗余特性隔离、工具箱模型等方法,显著提升了与Agentic Engineering研发流程的适配度。开发者可快速接入自研模型并进行迭代优化,无需重复底层适配工作。这种设计不仅加速了引擎自身的演进,也为具身智能生态的标准化开发提供了可能。
开源版本已支持PI 0.5、WALL-OSS两款具身模型,并计划持续扩展对VLA、VLM等新型模型的支持。硬件生态方面,除现有平台外,团队正在适配AMD等行业主流芯片,并探索国产化算力后端与机器人操作系统的兼容方案。通过量化优化等技术手段,APXInf正进一步挖掘nvfp4等低精度计算的潜力,以在更低功耗下实现更高性能。
APXInf的推出填补了具身智能技术链的关键空白。此前,无问芯穹团队曾开源全球首个面向具身智能的强化学习训练框架,而此次端侧推理引擎的开源,则完成了从模型训练到本体部署的技术闭环。开发者可基于同一套生态,实现从云端训练、效果验证到机器人端推理部署的全流程开发,大幅降低具身智能落地的技术门槛。
项目团队现面向全球开发者发出邀请,欢迎具身模型研究者、机器人团队及端侧系统开发者参与共建。无论是将现有模型部署至特定硬件平台,还是优化模型接入流程,亦或探索新型推理范式,APXInf的开源社区都将提供技术支撑与协作平台。相关代码与文档已通过GitHub公开,开发者可通过快速入门指南开启具身智能端侧开发之旅。











