RLinf官方正式支持摩尔线程MUSA架构
作者: 李祥敬
责任编辑: 李祥敬
来源: CBISMB
时间: 2026-09-24 14:15
浏览: 0
点赞: 0
收藏: 0
RLinf官方已正式支持MUSA后端运行,并上线相应部署文档;同时,官方CI自0.3版本起接入摩尔线程MTT S5000,所有代码commit在合入主分支前均须基于国产算力完成自动化验证。与此同时,双方正联合打造基于国产GPU的端云协同具身智能框架,云端采用MTT S5000、端侧采用MTT E300,覆盖训练、推理、仿真与渲染全场景。
一、RLinf框架:面向具身智能的“仿训推一体化”架构
RLinf是首个面向具身智能的大规模强化学习开源框架,其核心设计目标是打通渲染、训练、推理在系统层面的割裂。
- 设计哲学:坚持“同一份代码,改YAML就能换布局”。通过M2Flow编程范式降低开发复杂度,并利用一个队列解耦生产与消费,官方数据显示该架构可使系统吞吐达到2.43倍。
- 算法演进:Flow-Noise与Flow-SDE系列算法在主流测试集上带来30%~50%的性能提升;USER系统允许开发者“像使用GPU一样使用机器人”;RL-Co实现了仿真与真机的联合训练。
- 工程闭环:RLinf将原本割裂的四段后训练收敛为一条原生工程闭环,以LeRobot数据契约为桥,加速自定义脚本向RLinf原生编排层平移。
二、底层算力适配:MUSA后端接入与CI共建
RLinf官方已正式支持MUSA后端运行,并上线部署文档。自0.3版本起,官方CI(持续集成)已接入摩尔线程MTT S5000,所有代码commit在合入主分支前均须基于该国产算力完成自动化验证。这标志着国产算力与具身RL框架进入双向“共建”阶段。
三、实测验证:WoVR负载下的训练曲线对齐
为了验证MTT S5000承载前沿具身RL负载的能力,团队在RLinf框架上对WoVR负载完成了全量适配与复现。
- 实验配置:采用GRPO算法进行rollout action,使用WAN世界模型根据action想象执行结果,最后使用ResNet评估对错并给出奖励用于GRPO训练。全程无需真实机器人参与。
- 控制变量:在248个并行环境下,保持相同配方与随机种子,跑通LIBERO的Spatial与Goal两个任务套件。
- 对齐结果:在191步共同窗口内,S5000与国际主流GPU的训练曲线逐步相关系数达到r=0.976。在真机LIBERO-Spatial评估中,两套硬件训练出的策略成功率完全对齐。
四、性能优化:单步耗时拆解与算子级优化
针对全量适配后的性能瓶颈,团队对单步耗时进行了逐相拆解,并实施了三项核心工程改造:
- 图像处理迁移:将图像处理从主机端(Host)迁移至GPU端。
- 数值检查合并:去噪循环的数值检查由每步5次合并为整轮一次。
- 数据类型替换:热路径上的Python标量替换为0维设备张量。
优化成效:
- 整步耗时从2549秒降至1888秒(下降26%)。
- Env交互耗时降低14%,Rollout出动作耗时降低20%。
- GPU空转率由18.5%大幅压缩至3.1%。
- 算子级基准测试显示,S5000的GEMM与注意力性能达到国际主流GPU的1.6-2倍。
五、真机实战:双臂装配GPU的策略自进化飞轮
在具体的具身任务中,团队展示了基于π0.5模型的双臂机器人装配GPU(毫米级卡槽对准)的高难度实战。
数据飞轮构建:
- 阶段一:基于240条PICO双臂遥操作数据做全参数微调(SFT),真机初始成功率仅20%。
- 阶段二:通过三轮DAgger补齐OOD(分布外)状态,配合RECAP针对“斜靠卡槽”、“对准偏差”做定向纠偏。
- 阶段三:插入阶段引入RL Token,最终真机成功率稳定至92%,精细操作耗时缩短39.5%。
算力底座:MUSA将π0.5全量训练直接落到了单台8卡S5000上,四个阶段共用一套技术栈,无需切换运行环境。
六、真机控制端:低时延与平滑执行
针对云端推理带来的时延问题,系统通过以下技术实现精准控制:
- 动作分块:将419ms的云端指令赶在530ms执行周期结束前送达。
- 平滑处理:叠加RTC补偿、时序融合与Ruckig规划,将机械臂18.5°的动作跳变平滑压制到0.23°。
- 端云协同:未来规划按“可运行、可加速、可闭环、可验收”四步向端侧SoC芯片迁移,实现“云端训练和发布,端侧承担推理、RTC与轨迹执行”。
七、仿真与场景重建支撑
- 4DGS高保真重建:团队披露了面向具身操作的4DGS方案,可从操作台的多目视频端到端重建3D动态场景,为RL后训练与Sim2Real提供数据与评估支撑。
- 生态适配:MUSA已适配Newton、MuJoCo等主流物理仿真引擎,并接入RoboTwin等仿真环境。极佳视界基于MTT S5000与夸娥集群,联合完成了驾驶世界模型、具身世界模型的训练适配。其GigaBrain-0.7在四项精细操作任务评测中,平均成功率由SFT基线的30%经离线RL提升至57.5%,在线RL后进一步提升至100%。






京公网安备:11010502051901号