RLinf官方正式支持摩尔线程MUSA架构

作者: 李祥敬

责任编辑: 李祥敬

来源: CBISMB

时间: 2026-09-24 14:15

关键字: GPU 摩尔线程 MUSA

浏览: 0

点赞: 0

收藏: 0

RLinf官方已正式支持MUSA后端运行,并上线相应部署文档;同时,官方CI自0.3版本起接入摩尔线程MTT S5000,所有代码commit在合入主分支前均须基于国产算力完成自动化验证。与此同时,双方正联合打造基于国产GPU的端云协同具身智能框架,云端采用MTT S5000、端侧采用MTT E300,覆盖训练、推理、仿真与渲染全场景。

一、RLinf框架:面向具身智能的“仿训推一体化”架构

RLinf是首个面向具身智能的大规模强化学习开源框架,其核心设计目标是打通渲染、训练、推理在系统层面的割裂。

  • 设计哲学:坚持“同一份代码,改YAML就能换布局”。通过M2Flow编程范式降低开发复杂度,并利用一个队列解耦生产与消费,官方数据显示该架构可使系统吞吐达到2.43倍。
  • 算法演进:Flow-Noise与Flow-SDE系列算法在主流测试集上带来30%~50%的性能提升;USER系统允许开发者“像使用GPU一样使用机器人”;RL-Co实现了仿真与真机的联合训练。
  • 工程闭环:RLinf将原本割裂的四段后训练收敛为一条原生工程闭环,以LeRobot数据契约为桥,加速自定义脚本向RLinf原生编排层平移。

二、底层算力适配:MUSA后端接入与CI共建

RLinf官方已正式支持MUSA后端运行,并上线部署文档。自0.3版本起,官方CI(持续集成)已接入摩尔线程MTT S5000,所有代码commit在合入主分支前均须基于该国产算力完成自动化验证。这标志着国产算力与具身RL框架进入双向“共建”阶段。

三、实测验证:WoVR负载下的训练曲线对齐

为了验证MTT S5000承载前沿具身RL负载的能力,团队在RLinf框架上对WoVR负载完成了全量适配与复现。

  • 实验配置:采用GRPO算法进行rollout action,使用WAN世界模型根据action想象执行结果,最后使用ResNet评估对错并给出奖励用于GRPO训练。全程无需真实机器人参与。
  • 控制变量:在248个并行环境下,保持相同配方与随机种子,跑通LIBERO的Spatial与Goal两个任务套件。
  • 对齐结果:在191步共同窗口内,S5000与国际主流GPU的训练曲线逐步相关系数达到r=0.976。在真机LIBERO-Spatial评估中,两套硬件训练出的策略成功率完全对齐。

四、性能优化:单步耗时拆解与算子级优化

针对全量适配后的性能瓶颈,团队对单步耗时进行了逐相拆解,并实施了三项核心工程改造:

  • 图像处理迁移:将图像处理从主机端(Host)迁移至GPU端。
  • 数值检查合并:去噪循环的数值检查由每步5次合并为整轮一次。
  • 数据类型替换:热路径上的Python标量替换为0维设备张量。

优化成效:

  • 整步耗时从2549秒降至1888秒(下降26%)。
  • Env交互耗时降低14%,Rollout出动作耗时降低20%。
  • GPU空转率由18.5%大幅压缩至3.1%。
  • 算子级基准测试显示,S5000的GEMM与注意力性能达到国际主流GPU的1.6-2倍。

五、真机实战:双臂装配GPU的策略自进化飞轮

在具体的具身任务中,团队展示了基于π0.5模型的双臂机器人装配GPU(毫米级卡槽对准)的高难度实战。

数据飞轮构建:

  • 阶段一:基于240条PICO双臂遥操作数据做全参数微调(SFT),真机初始成功率仅20%。
  • 阶段二:通过三轮DAgger补齐OOD(分布外)状态,配合RECAP针对“斜靠卡槽”、“对准偏差”做定向纠偏。
  • 阶段三:插入阶段引入RL Token,最终真机成功率稳定至92%,精细操作耗时缩短39.5%。

算力底座:MUSA将π0.5全量训练直接落到了单台8卡S5000上,四个阶段共用一套技术栈,无需切换运行环境。

六、真机控制端:低时延与平滑执行

针对云端推理带来的时延问题,系统通过以下技术实现精准控制:

  • 动作分块:将419ms的云端指令赶在530ms执行周期结束前送达。
  • 平滑处理:叠加RTC补偿、时序融合与Ruckig规划,将机械臂18.5°的动作跳变平滑压制到0.23°。
  • 端云协同:未来规划按“可运行、可加速、可闭环、可验收”四步向端侧SoC芯片迁移,实现“云端训练和发布,端侧承担推理、RTC与轨迹执行”。

七、仿真与场景重建支撑

  • 4DGS高保真重建:团队披露了面向具身操作的4DGS方案,可从操作台的多目视频端到端重建3D动态场景,为RL后训练与Sim2Real提供数据与评估支撑。
  • 生态适配:MUSA已适配Newton、MuJoCo等主流物理仿真引擎,并接入RoboTwin等仿真环境。极佳视界基于MTT S5000与夸娥集群,联合完成了驾驶世界模型、具身世界模型的训练适配。其GigaBrain-0.7在四项精细操作任务评测中,平均成功率由SFT基线的30%经离线RL提升至57.5%,在线RL后进一步提升至100%。
©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。
地址:北京市朝阳区北三环东路三元桥曙光西里甲1号第三置业A座1508室 电话:13391790444或(010)62178877
版权所有:电脑商情信息服务集团 北京赢邦策略咨询有限责任公司
声明:本媒体部分图片、文章来源于网络,版权归原作者所有,我司致力于保护作者版权,如有侵权,请与我司联系删除

京ICP备:2022009079号-2

京公网安备:11010502051901号

ICP证:京B2-20230255