Meshy

面壁智能开源的LLM异步强化学习训练引擎,服务化解耦推理、采样与训练

Meshy 是面壁智能 OpenBMB 开源的大模型异步强化学习训练引擎,即 MiniCPM5-2B 背后的 RL 训练栈。它将推理、rollout 与训练建模为独立服务进程,样本经单一 TransferQueue 数据平面流动,控制流由数据可用性驱动,拓扑由各进程从一份声明式 recipe 本地推导,无需中心 driver 转发张量;基于 SGLang 与 torchtitan,支持 on-policy、有界 off-policy 与全异步训练,提供 Docker 镜像,Apache 2.0 许可

强化学习训练
访问官网
收录动态

2

最近更新

2026-09-09

评价样本

未收录

GitHub Stars

136

工具功能

这个工具能做什么、适合谁用,以及目前已识别的核心能力。

工具简介

Meshy 是面壁智能 OpenBMB 开源的大模型异步强化学习训练引擎,即 MiniCPM5-2B 背后的 RL 训练栈。它将推理、rollout 与训练建模为独立服务进程,样本经单一 TransferQueue 数据平面流动,控制流由数据可用性驱动,拓扑由各进程从一份声明式 recipe 本地推导,无需中心 driver 转发张量;基于 SGLang 与 torchtitan,支持 on-policy、有界 off-policy 与全异步训练,提供 Docker 镜像,Apache 2.0 许可

核心功能

1 项已整理
强化学习训练

价格信息

免费

当前仅展示已核验的定价模式。

基础信息

更新频率
近 7 天 2 条收录动态
最近更新
2026-09-09
覆盖行业

更新日志

按时间记录功能更新、版本发布、新工具入库等重要变化。

  1. 2026-09-09版本发布

    面壁智能 OpenBMB 的异步 RL 训练引擎 Meshy 发布首个正式版本 v0.1.0:采用无 Ray 的角色驱动架构,推理、训练与 rollout 作为独立服务经统一 TransferQueue 数据/控制平面协同,同一套服务支持 on-policy、有界 off-policy 与全异步 RL 训练;支持上下文并行、动态批处理与最高 128K token 长上下文训练,内置 GRPO+GSM8K/MATH、JustRL 复现等 recipe,并提供 Docker 镜像 ztonyzhao/meshy:0.1.0。

  2. 2026-09-08开源

    面壁智能 OpenBMB 在开源 MiniCPM5-2B 次日,开源其背后的 RL 训练栈 Meshy:服务化异步 RL 训练框架,将推理、rollout 与训练解耦为统一 TransferQueue 数据平面上的独立服务进程,基于 SGLang 与 torchtitan,同一套服务支持 on-policy、有界 off-policy 与全异步训练,采用 Apache 2.0 许可证。

Meshy 常见问题

关于 Meshy 的定位、核心功能、价格与最近更新。

Meshy 是什么?

Meshy 是面壁智能 OpenBMB 开源的大模型异步强化学习训练引擎,即 MiniCPM5-2B 背后的 RL 训练栈。它将推理、rollout 与训练建模为独立服务进程,样本经单一 TransferQueue 数据平面流动,控制流由数据可用性驱动,拓扑由各进程从一份声明式 recipe 本地推导,无需中心 driver 转发张量;基于 SGLang 与 torchtitan,支持 on-policy、有界 off-policy 与全异步训练,提供 Docker 镜像,Apache 2.0 许可。

Meshy 有哪些核心功能?

Meshy 当前已核验的核心功能包括:强化学习训练。

Meshy 如何收费?

Meshy 当前已核验的价格模式为免费。

Meshy 最近有什么更新?

2026-09-09:面壁智能 OpenBMB 的异步 RL 训练引擎 Meshy 发布首个正式版本 v0.1.0:采用无 Ray 的角色驱动架构,推理、训练与 rollout 作为独立服务经统一 TransferQueue 数据/控制平面协同,同一套服务支持 on-policy、有界 off-policy 与全异步 RL 训练;支持上下文并行、动态批处理与最高 128K token 长上下文训练,内置 GRPO+GSM8K/MATH、JustRL 复现等 recipe,并提供 Docker 镜像 ztonyzhao/meshy:0.1.0。