MiniCPM是面壁智能(OpenBMB)自主研发的端侧大模型系列,包括文本基座模型MiniCPM5-1B、稀疏注意力模型MiniCPM-SALA等。专为端侧部署和资源受限场景设计,支持本地助手、编码代理、工具调用和长上下文推理。
Capability Timeline
具身导航
使机器人通过视觉感知和语言指令在物理环境中自主导航的能力。
相关工具
9Xiaomi-Robotics-U0是小米推出的380亿参数多模态自回归世界基础模型,专为具身智能设计。在单一框架内统一文生图、图像编辑、多视角具身场景生成、具身迁移和具身视频生成五项任务,支持跨多种机器人形态的高质量多视角场景生成,并实现结构化可控的具身迁移编辑,同时保持多视角一致性与交互动态。
MiniCPM-Robot 是面壁智能(OpenBMB)面向真实世界感知、决策与行动的开源具身智能模型系列。首批包含 1.5B 通用机器人操作 VLA 模型 MiniCPM-RobotManip,一套权重覆盖下游任务并支持流式上下文记忆;以及 0.9B 纯端侧具身目标跟踪方案 MiniCPM-RobotTrack,覆盖静态、动态与对抗目标。配套 PhyAI 推理框架在 NVIDIA H20 上将推理帧率从 10 Hz 提升至 37 Hz。
NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。
RLinf 是由无问芯穹联合清华大学等共同研发的全球首个面向具身智能持续进化的大规模强化学习基础设施项目。它提供从数据采集、数据管理、监督微调(SFT)、强化学习(RL)、模型评测到真机部署的一站式开发平台,支持多种具身模型(VLA模型、世界模型)、仿真器(Genesis、Polaris、RoboVerse、IsaacLab)、真机平台(Franka、GimArm、DOS-W1)以及异构计算硬件(昇腾、AMD ROCm、Musa),实现从仿真训练到真实机器人在线学习的统一开发闭环。
Robostral Navigate 是 Mistral AI 的首个具身导航 8B 模型,仅需单个 RGB 摄像头即可接收自然语言指令驱动机器人在复杂环境中自主导航。R2R-CE 验证集未见场景成功率达 76.6%,超越多传感器方案。
Xiaomi-Robotics-1 是小米技术发布的具身基座模型,结合10万小时无本体(UMI)真实世界操作数据预训练与约10000小时跨本体后训练,可根据自然语言指令直接执行移动操作任务。在RoboCasa365基准平均成功率57.4%,在RoboDojo仿真评测登顶Leaderboard。
DW05 是原力灵机(Dexmal)发布的开源具身世界模型,采用 MoT 架构,以 Wan 为骨干网络,配合 Video Expert、Action Expert、Value Expert 三大专家模块,统一未来视频预测、动作生成与状态价值评估。支持语言、图像/视频、机器人类型、状态和动作多模态输入,可预测动作执行后的未来状态、生成失败轨迹并对任务进度打分,用于 VLA 模型后训练中的强化学习环境。已发布模型权重、推理代码和训练代码,采用 Apache-2.0 许可证。
Galbot 银河通用是全球具身智能机器人公司,致力于具身多模态大模型通用机器人研发,服务千行百业、千家万户。团队发布全球首个面向具身智能大模型的测试时后训练框架 WAM-TTT,基于预训练世界动作模型(WAM),仅凭未标注人类视频即可在部署阶段适配新场景,实现机器人部署后的持续学习与跨场景泛化。



