盖世具身智能获悉近日,星尘智能团队发布了在线强化学习框架SmoothRL,由王佳楠担任项目负责人。
该框架首次将异步onlineRL放到真实高动态投掷任务中验证,让在线学习不只处理“最后几毫米”的精度问题,也进入连续加速、精确释放、不能停顿的动态操作,从而解决机器人在连续执行任务过程中,模型异步推理与真实执行动作不一致导致的在线学习复盘偏差问题。在线强化学习后,机器人失败模式发生显著变化。在真实自主投掷rollout中,在线RL后右侧末端执行器的加速度RMS降低52%,jerk降低47%不过星尘智能表示,SmoothRL当前还存在一定边界,模型推理时间需要控制在预设预算内,而且当前方法主要是在冻结基础策略附近做有限幅度的修正。
