MiniCPM是面壁智能(OpenBMB)自主研发的端侧大模型系列,包括文本基座模型MiniCPM5-1B、稀疏注意力模型MiniCPM-SALA等。专为端侧部署和资源受限场景设计,支持本地助手、编码代理、工具调用和长上下文推理。
Capability Timeline
世界模型
理解或预测世界状态,用于机器人、仿真或具身智能。
相关工具
14Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。
Happy Oyster 是一款实时世界模型,用户可进入可实时导航的 AI 生成世界,探索精选世界或亲自执导、实时塑造故事走向。产品已正式上线 Reactor 平台,并提供 API 供开发者调用,适用于交互式世界探索与实时内容生成场景。
LeMario 是一个从零实现的动作条件联合嵌入预测架构(JEPA)世界模型,在《超级马里奥兄弟》上训练。模型从游戏画面和手柄输入中学习短期潜在动态,使用 AdaLN-Zero 将动作注入六层 Transformer 预测器,并通过交叉熵方法(CEM)在潜在空间进行无奖励规划。项目在 737134 帧、280 个回合、32 个关卡上训练,验证了短时程动作条件动态预测的有效性,同时揭示了预测状态与控制状态之间的根本差异。
NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。
Pantograph 推出的首个目标条件强化学习模型,通过互联网规模视频预训练学习目标导向行为。Pan-4B 拥有40亿参数,在约50万小时 Minecraft 视频上预训练,再经约2000小时承包商轨迹后训练。模型能根据目标图像指令在 Minecraft 中战斗、探索、建造和完成平台跳跃任务,并可泛化到未见过的环境。
PixVerse 是全球 AI 视频生成平台,提供文生视频、图生视频、视频编辑、口型同步、音频生成等能力。旗舰模型 V6 支持电影级镜头控制与角色表演。2026 年 1 月发布 R1 实时世界模型,将视频转变为可交互的连续流,并推出 PixVerse Game Engine 将实时世界模型应用于游戏创作,玩家可用自然语言交互,世界实时响应。平台还提供 API、智能体、营销中心、画布等企业级工作流工具。
RLinf 是由无问芯穹联合清华大学等共同研发的全球首个面向具身智能持续进化的大规模强化学习基础设施项目。它提供从数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测到真机部署的一站式开发平台,支持多种具身模型(VLA模型、世界模型)、仿真器(Genesis、Polaris、RoboVerse、IsaacLab)、真机平台(Franka、GimArm、DOS-W1)以及异构计算硬件(昇腾、AMD ROCm、Musa),实现从仿真训练到真实机器人在线学习的统一开发闭环。
WeRide WITT 是文远知行 WeRide 自研的物理 AI 认知基础大模型,全称 World Intelligence Toward Truth。基于视觉语言大模型(VLM)能力,WITT 引入"最小物理事实单元"概念,打通视频、图像、文本等多模态信息,将连续变化的真实场景拆解为可被识别和验证的事实单元。WITT 具备事实提取、事实推理、事实验证、事实编排四大核心能力,内置视频数据引擎支持关键词或自然语言检索海量视频数据,与文远知行世界模型 WeRide GENESIS 协同训练自动驾驶车端模型。
Xiaomi-Robotics-1 是小米技术发布的具身基座模型,结合10万小时无本体(UMI)真实世界操作数据预训练与约10000小时跨本体后训练,可根据自然语言指令直接执行移动操作任务。在RoboCasa365基准平均成功率57.4%,在RoboDojo仿真评测登顶Leaderboard。
阿里云百炼是全链路大模型服务平台,提供百余款千问系列及第三方大模型即开即用,内置Agent工具链支持MCP托管与智能体搭建,支持Vibe Coding编程开发、图像生成、视觉理解、视频生成等多元AI能力,覆盖从模型调用到应用部署的一站式AI落地流程。
DW05 是原力灵机(Dexmal)发布的开源具身世界模型,采用 MoT 架构,以 Wan 为骨干网络,配合 Video Expert、Action Expert、Value Expert 三大专家模块,统一未来视频预测、动作生成与状态价值评估。支持语言、图像/视频、机器人类型、状态和动作多模态输入,可预测动作执行后的未来状态、生成失败轨迹并对任务进度打分,用于 VLA 模型后训练中的强化学习环境。已发布模型权重、推理代码和训练代码,采用 Apache-2.0 许可证。
Galbot 银河通用是全球具身智能机器人公司,致力于具身多模态大模型通用机器人研发,服务千行百业、千家万户。团队发布全球首个面向具身智能大模型的测试时后训练框架 WAM-TTT,基于预训练世界动作模型(WAM),仅凭未标注人类视频即可在部署阶段适配新场景,实现机器人部署后的持续学习与跨场景泛化。
Skyfall AI 是由被微软收购的深度学习先驱 Maluuba 创始团队新成立的前沿研究实验室,目标是超越当前 LLM 范式、构建首个自主企业(Autonomous Enterprise)。其核心路线是研发企业世界模型(Enterprise World Models),让系统通过持续学习模拟战略行动的连锁后果,并通过持续强化学习平台 Morpheus 验证技术,最终收购软件企业并让其全自主运行。



