SmoothRL

面向异步推理执行的真实机器人在线强化学习框架,让机器人在真实部署中边执行边修正策略

SmoothRL 是星尘智能(Astribot)基座模型团队发布的基于异步推理执行的在线强化学习框架。它在真实机器人异步推理与部署下,将 action chunk 划分为已提交、执行与丢弃三个区域,仅让梯度穿过机器人真正执行的动作,使训练优化目标与真实执行时间线一致,并从训练起就运行异步推理以对齐部署节奏。以冻结基础策略为先验,轻量子策略在原始动作空间做残差修正,支持实时人工介入与稀疏奖励。在绳驱本体 S1 的动态投掷、给笔戴帽、快递开箱等真实任务中显著提升成功率并降低急动度

强化学习训练机器人操作
访问官网
收录动态

1

最近更新

2026-09-04

评价样本

未收录

社区规模

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

SmoothRL 是星尘智能(Astribot)基座模型团队发布的基于异步推理执行的在线强化学习框架。它在真实机器人异步推理与部署下,将 action chunk 划分为已提交、执行与丢弃三个区域,仅让梯度穿过机器人真正执行的动作,使训练优化目标与真实执行时间线一致,并从训练起就运行异步推理以对齐部署节奏。以冻结基础策略为先验,轻量子策略在原始动作空间做残差修正,支持实时人工介入与稀疏奖励。在绳驱本体 S1 的动态投掷、给笔戴帽、快递开箱等真实任务中显著提升成功率并降低急动度

核心功能

2 项已整理
强化学习训练
机器人操作

价格信息

暂无可验证价格信息

暂无足够准确的价格信息。

基础信息

更新频率
近 7 天 1 条收录动态
最近更新
2026-09-04
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-09-04版本发布

    星尘智能基座模型团队发布可异步执行的在线强化学习框架 SmoothRL,首次将异步 online RL 放到真实高动态投掷等任务验证,将 action chunk 划分为已提交/执行/丢弃区域并仅对真实执行动作做梯度更新,动态投掷成功率由 39% 提升至 94%。

SmoothRL 常见问题

关于 SmoothRL 的定位、核心功能、价格与最近更新。

SmoothRL 是什么?

SmoothRL 是星尘智能(Astribot)基座模型团队发布的基于异步推理执行的在线强化学习框架。它在真实机器人异步推理与部署下,将 action chunk 划分为已提交、执行与丢弃三个区域,仅让梯度穿过机器人真正执行的动作,使训练优化目标与真实执行时间线一致,并从训练起就运行异步推理以对齐部署节奏。以冻结基础策略为先验,轻量子策略在原始动作空间做残差修正,支持实时人工介入与稀疏奖励。在绳驱本体 S1 的动态投掷、给笔戴帽、快递开箱等真实任务中显著提升成功率并降低急动度。

SmoothRL 有哪些核心功能?

SmoothRL 当前已核验的核心功能包括:强化学习训练、机器人操作。

SmoothRL 如何收费?

AI Equal 当前没有收录 SmoothRL 的可验证价格信息。

SmoothRL 最近有什么更新?

2026-09-04:星尘智能基座模型团队发布可异步执行的在线强化学习框架 SmoothRL,首次将异步 online RL 放到真实高动态投掷等任务验证,将 action chunk 划分为已提交/执行/丢弃区域并仅对真实执行动作做梯度更新,动态投掷成功率由 39% 提升至 94%。

SmoothRL:功能、价格、更新日志与同类对比 | AI Equal