Kimi K3 是月之暗面推出的 AI 助手,专为智能体编程与知识工作打造。支持 Swarm 智能体集群与 Goal 模式并行执行任务,可构建可玩的多人与3D游戏,生成咨询级 PPT,处理 Excel 和 PDF 文档,提供深度研究与建站能力。
Capability Timeline
模型训练学习
训练教程、模型机制、深度学习和模型构建资料。
相关工具
19Grok 是由 xAI 构建的 AI 助手,支持聊天对话、图像创建、代码编写,并能从网络和 X 平台获取实时信息回答用户问题。订阅用户可通过 Grok Heavy 等套餐获得 X Premium+ 等增值权益。
Inertia-1 是一个开放的统一运动基础模型研究项目,基于超过 1800 万小时的全球加速度计数据自监督预训练,旨在用单一表征覆盖不同身体佩戴位置、传感器类型(加速度计、陀螺仪、磁力计)与采样率,支持活动识别、步态检测与长期健康监测等任务,无需针对新位置重新训练即可迁移。
Inkling 是 Thinking Machines Lab 发布的首个开源权重 MoE 模型,总参数量975B、活跃参数41B,支持100万token上下文窗口。模型原生支持文本、图像和音频理解,具备代码生成、智能体工具调用等能力,可通过 Tinker 平台进行微调定制。
LeMario 是一个从零实现的动作条件联合嵌入预测架构(JEPA)世界模型,在《超级马里奥兄弟》上训练。模型从游戏画面和手柄输入中学习短期潜在动态,使用 AdaLN-Zero 将动作注入六层 Transformer 预测器,并通过交叉熵方法(CEM)在潜在空间进行无奖励规划。项目在 737134 帧、280 个回合、32 个关卡上训练,验证了短时程动作条件动态预测的有效性,同时揭示了预测状态与控制状态之间的根本差异。
Mistral AI 是法国前沿 AI 公司,提供自研大语言模型、面向长周期任务的 AI 智能体与企业级 AI 平台,支持企业知识搜索、结构化数据分析、文档与报告合成、异步代码生成、自动化 CI/CD,以及自定义模型训练与蒸馏,可在自托管环境、Mistral 云或第三方云上部署。
NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。
Poolside Laguna S 2.1 是 Poolside 发布的 118B 总参数、8B 激活参数 MoE 大模型,支持 1M token 上下文窗口,包含 thinking 与 no-thinking 两种模式,从训练到发布不足九周。Laguna S 2.1 面向长程编码与推理任务,在 Terminal-Bench 2.1、SWE-Bench Multilingual、SWE-Bench Pro、DeepSWE 等编码基准上对标远大于自身规模的模型,权重开源并公开全部评估轨迹。
Tunix 是 Google 推出的基于 JAX 的原生后训练库,面向多轮、使用工具的 LLM 推理智能体训练场景。它通过高并发异步 rollout 引擎和解耦的生产者-消费者流水线消除 TPU 闲置瓶颈,原生集成 vLLM-TPU 与 SGLang-Jax 推理引擎,并提供围绕 RL 指标的持续轻量级性能观测能力,帮助开发者最大化硬件吞吐量并保持环境模块化。
TuringViT 是小鹏基础模型团队发布的高效视觉 Transformer 编码器,通过 Turing 线性注意力架构、VISTA-Curation 数据治理流水线与原生动态分辨率训练,仅用主流基线 10% 的图文数据即可达到 SOTA 级零样本性能,并在高分辨率输入下显著降低推理延迟。提供 18L 与 24L 两个规格,面向 VLM/VLA 下游场景,支撑智能驾驶、智能座舱与 IRON 人形机器人感知。
Xiaomi-Robotics-1 是小米技术发布的具身基座模型,结合10万小时无本体(UMI)真实世界操作数据预训练与约10000小时跨本体后训练,可根据自然语言指令直接执行移动操作任务。在RoboCasa365基准平均成功率57.4%,在RoboDojo仿真评测登顶Leaderboard。
ZUNA1.1 是 Zyphra 发布的开源 EEG 基础模型,基于 380M 参数的掩码扩散自编码器,可对头皮脑电信号进行去噪、缺失通道重建和稀疏电极布局上采样。模型基于电极 3D 头皮坐标而非固定通道列表,支持从 4 通道到 256 通道的任意蒙太奇,无需重新训练即可使用。支持 0.5 至 30 秒变长输入,在消费级 GPU 或 Apple Silicon 上运行,权重托管于 Hugging Face,代码托管于 GitHub,Apache 2.0 许可证。
天数智芯是国内领先的通用GPU芯片及算力系统提供商,致力于开发自主可控的通用GPU产品。产品线包括天垓系列训练GPU(天垓100、天垓150、天垓300)和智铠系列推理GPU(智铠100)。天垓300是其2026年发布的新一代旗舰通用GPU,基于SIMT架构,支持标量、矢量与张量计算,针对Attention、MoE及大规模系统扩展进行了深度优化,已具备规模化应用条件。
百度智能云是百度旗下的全栈AI云平台,提供从算力底座(百舸AI计算平台、天池超节点)、大模型服务(千帆大模型平台、文心系列模型)到Agent开发与应用的全栈能力。平台支持企业构建数字员工、视觉智能体、深度研究助手等AI应用,并提供AI安全护栏、内容审核、数据分析等企业级服务。在WAIC 2026上展出的天池256超节点支持256卡互联,推理效率提升50%。
国家超算互联网是国家级算力服务平台,连接全国超算智算中心,提供算力调度、应用商城、AI社区及低代码开发环境。平台搭载科学计算智能体,汇聚超万项技能与智能体组件,支持大模型训练与AI推理,为科研院所和个人开发者提供算力、数据、工具全栈配套支撑。
Google DeepMind 实验性文本扩散模型,4倍加速文本生成
DiffusionGemma 是 Google DeepMind 实验性开源文本扩散模型,基于 Gemma 4 与 Gemini Diffusion 研究。26B MoE 架构仅激活 3.8B 参数,可在 18GB VRAM GPU 上运行。并行生成 256 token 文本块,H100 上达每秒 1000+ token,比自回归模型快 4 倍。支持双向注意力,适用于行内编辑、代码补全与非线性文本生成,可通过 Unsloth、NeMo 微调。
Fireworks AI 是由 PyTorch 创始团队打造的生成式 AI 推理与训练云平台,日处理超 40 万亿 token。平台提供 250+ 开源模型(Qwen、Kimi、DeepSeek、MiniMax、GLM、Llama 等)的无服务器与专属部署推理,兼容 OpenAI 与 Anthropic API,支持模型后训练,训练与推理在同一技术栈闭环运行,并具备 SOC 2 Type II、HIPAA、GDPR 合规能力。
Soofi S 是一项德国研究项目,旨在开发开放且主权的欧洲大型语言与推理模型及基于代理的智能系统。该平台具备高度透明性,支持在欧洲云端与边缘基础设施上进行本地化部署。此外,它通过初步验证实际使用场景,致力于将先进模型能力平滑迁移至真实业务环境,以支持欧洲AI生态的实际落地与自主可控
Tinker 是 Thinking Machines 推出的模型训练与微调 API,面向研究者和开发者。用户通过 forward_backward、optim_step、sample、save_state 四个原语完全掌控训练循环、数据与算法,平台托管算力与基础设施。支持以 LoRA 高效微调 Qwen 等开源模型,可用于监督微调与强化学习实验,并配套 cookbook 提供常见微调示例。



