功能图谱

Capability Timeline

强化学习训练

为具身智能和智能体提供强化学习训练流程、算法和基础设施支持。

5 个工具4 条动态

相关工具

5

基于互联网视频预训练的目标条件强化学习模型

Pantograph 推出的首个目标条件强化学习模型,通过互联网规模视频预训练学习目标导向行为。Pan-4B 拥有40亿参数,在约50万小时 Minecraft 视频上预训练,再经约2000小时承包商轨迹后训练。模型能根据目标图像指令在 Minecraft 中战斗、探索、建造和完成平台跳跃任务,并可泛化到未见过的环境。

强化学习训练世界模型图像理解游戏AI角色
近7天 1 动态

面向具身智能与智能体的开源强化学习训练基础设施

RLinf 是由无问芯穹联合清华大学等共同研发的全球首个面向具身智能持续进化的大规模强化学习基础设施项目。它提供从数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测到真机部署的一站式开发平台,支持多种具身模型(VLA模型、世界模型)、仿真器(Genesis、Polaris、RoboVerse、IsaacLab)、真机平台(Franka、GimArm、DOS-W1)以及异构计算硬件(昇腾、AMD ROCm、Musa),实现从仿真训练到真实机器人在线学习的统一开发闭环。

具身导航强化学习训练世界模型智能体
近7天 1 动态4,197 Stars

Google 基于 JAX 的大模型后训练库,支持高吞吐智能体 RL 训练

Tunix 是 Google 推出的基于 JAX 的原生后训练库,面向多轮、使用工具的 LLM 推理智能体训练场景。它通过高并发异步 rollout 引擎和解耦的生产者-消费者流水线消除 TPU 闲置瓶颈,原生集成 vLLM-TPU 与 SGLang-Jax 推理引擎,并提供围绕 RL 指标的持续轻量级性能观测能力,帮助开发者最大化硬件吞吐量并保持环境模块化。

模型训练学习强化学习训练
近7天 1 动态
DW

开源具身世界模型,统一视频预测、动作生成与价值评估

DW05 是原力灵机(Dexmal)发布的开源具身世界模型,采用 MoT 架构,以 Wan 为骨干网络,配合 Video Expert、Action Expert、Value Expert 三大专家模块,统一未来视频预测、动作生成与状态价值评估。支持语言、图像/视频、机器人类型、状态和动作多模态输入,可预测动作执行后的未来状态、生成失败轨迹并对任务进度打分,用于 VLA 模型后训练中的强化学习环境。已发布模型权重、推理代码和训练代码,采用 Apache-2.0 许可证。

具身导航强化学习训练世界模型视频生成
近7天 0 动态55 Stars

Thinking Machines 的模型训练 API,用 LoRA 微调开源模型

Tinker 是 Thinking Machines 推出的模型训练与微调 API,面向研究者和开发者。用户通过 forward_backward、optim_step、sample、save_state 四个原语完全掌控训练循环、数据与算法,平台托管算力与基础设施。支持以 LoRA 高效微调 Qwen 等开源模型,可用于监督微调与强化学习实验,并配套 cookbook 提供常见微调示例。

模型训练学习强化学习训练
近7天 0 动态