功能图谱

Capability Timeline

世界模型

理解或预测世界状态,用于机器人、仿真或具身智能。

14 个工具15 条动态

相关工具

14

小米380亿参数具身智能世界基础模型

Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。

具身导航世界模型视频生成图像编辑图像生成
近7天 2 动态

基于JEPA架构的超级马里奥世界模型

LeMario 是一个从零实现的动作条件联合嵌入预测架构(JEPA)世界模型,在《超级马里奥兄弟》上训练。模型从游戏画面和手柄输入中学习短期潜在动态,使用 AdaLN-Zero 将动作注入六层 Transformer 预测器,并通过交叉熵方法(CEM)在潜在空间进行无奖励规划。项目在 737134 帧、280 个回合、32 个关卡上训练,验证了短时程动作条件动态预测的有效性,同时揭示了预测状态与控制状态之间的根本差异。

模型训练学习世界模型
近7天 1 动态17 Stars

英伟达开源物理AI世界基础模型平台

NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。

具身导航模型训练学习目标检测世界模型视频生成
近7天 1 动态

基于互联网视频预训练的目标条件强化学习模型

Pantograph 推出的首个目标条件强化学习模型,通过互联网规模视频预训练学习目标导向行为。Pan-4B 拥有40亿参数,在约50万小时 Minecraft 视频上预训练,再经约2000小时承包商轨迹后训练。模型能根据目标图像指令在 Minecraft 中战斗、探索、建造和完成平台跳跃任务,并可泛化到未见过的环境。

强化学习训练世界模型图像理解游戏AI角色
近7天 1 动态

全球 AI 视频生成平台,提供实时世界模型与游戏引擎

PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。

世界模型视频处理视频生成图像编辑音乐生成
近7天 1 动态

面向具身智能与智能体的开源强化学习训练基础设施

RLinf 是由无问芯穹联合清华大学等共同研发的全球首个面向具身智能持续进化的大规模强化学习基础设施项目。它提供从数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测到真机部署的一站式开发平台,支持多种具身模型(VLA模型、世界模型)、仿真器(Genesis、Polaris、RoboVerse、IsaacLab)、真机平台(Franka、GimArm、DOS-W1)以及异构计算硬件(昇腾、AMD ROCm、Musa),实现从仿真训练到真实机器人在线学习的统一开发闭环。

具身导航强化学习训练世界模型智能体
近7天 1 动态4,197 Stars

文远知行自研物理AI认知基础大模型

WeRide WITT 是文远知行 WeRide 自研的物理 AI 认知基础大模型,全称 World Intelligence Toward Truth。基于视觉语言大模型(VLM)能力,WITT 引入"最小物理事实单元"概念,打通视频、图像、文本等多模态信息,将连续变化的真实场景拆解为可被识别和验证的事实单元。WITT 具备事实提取、事实推理、事实验证、事实编排四大核心能力,内置视频数据引擎支持关键词或自然语言检索海量视频数据,与文远知行世界模型 WeRide GENESIS 协同训练自动驾驶车端模型。

世界模型视频处理图像理解
近7天 1 动态
DW

开源具身世界模型,统一视频预测、动作生成与价值评估

DW05 是原力灵机(Dexmal)发布的开源具身世界模型,采用 MoT 架构,以 Wan 为骨干网络,配合 Video Expert、Action Expert、Value Expert 三大专家模块,统一未来视频预测、动作生成与状态价值评估。支持语言、图像/视频、机器人类型、状态和动作多模态输入,可预测动作执行后的未来状态、生成失败轨迹并对任务进度打分,用于 VLA 模型后训练中的强化学习环境。已发布模型权重、推理代码和训练代码,采用 Apache-2.0 许可证。

具身导航强化学习训练世界模型视频生成
近7天 0 动态55 Stars

银河通用具身多模态大模型通用机器人

Galbot 银河通用是全球具身智能机器人公司,致力于具身多模态大模型通用机器人研发,服务千行百业、千家万户。团队发布全球首个面向具身智能大模型的测试时后训练框架 WAM-TTT,基于预训练世界动作模型(WAM),仅凭未标注人类视频即可在部署阶段适配新场景,实现机器人部署后的持续学习与跨场景泛化。

具身导航世界模型
近7天 0 动态

Maluuba创始人创立的企业世界模型实验室

Skyfall AI 是由被微软收购的深度学习先驱 Maluuba 创始团队新成立的前沿研究实验室,目标是超越当前 LLM 范式、构建首个自主企业(Autonomous Enterprise)。其核心路线是研发企业世界模型(Enterprise World Models),让系统通过持续学习模拟战略行动的连锁后果,并通过持续强化学习平台 Morpheus 验证技术,最终收购软件企业并让其全自主运行。

世界模型
近7天 0 动态