Mojo 是 Modular 推出的编程语言,语法接近 Python 并提供内存安全、类型系统与编译期元编程能力。开发者可用同一门语言编写 CPU 与 GPU 内核,无需 CUDA 或额外 DSL,并可直接导入 Python 库、把性能关键路径逐步迁移到 Mojo,覆盖从数据中心到边缘、从 CPU 到 NPU 的多层计算系统开发。
Capability Timeline
GPU内核编程
编写和优化在 GPU 等加速器上运行的计算内核,替代 CUDA 等专用方案
相关工具
4vgpu 是 Vercel 开源并用于构建 vercel.com 着色器的 TypeScript WebGPU 库。它将 .wgsl 文件当作可导入导出的 TS 模块处理,通过反射自动保持绑定与布局一致。库提供单一 Gpu 上下文,同一套 API 可在浏览器、Dawn 无头 Node.js 与确定性 CI mock 三套运行时中运行。完整全屏效果 gzip 后仅 25 KB,体积预算由 CI 强制。库还提供 CLI、llms.txt 与 agent 技能,适合 WebGPU 着色器、3D 场景与 GPU 张量计算。
AMD ROCm 是 AMD 的开源 GPU 计算开放软件平台,提供编译器、运行时和数学/稀疏/通信库等完整生态,支持 AI、HPC 及领域特定负载,针对 Instinct、Radeon、Ryzen AI 平台优化。ROCm 包含 HIP 运行时、性能分析与调试工具,并通过 PyTorch、JAX、vLLM、SGLang、MIGraphX、ONNX Runtime 等框架支持深度学习训练与 AI 推理,同时提供 ROCm.AI(含 Hyperloom 自主智能体、AMD Skills 技能库与 ROCm CLI)。
CUDA Agent 是字节跳动 Seed 与清华大学 AIR 提出的开源研究系统,通过数据合成、技能增强的 CUDA 开发环境与强化学习算法,训练大语言模型生成高性能 CUDA 内核。在 KernelBench 的 Level-1/2/3 上达到 100%/100%/92% 快于 torch.compile,Level-3 上比 Claude Opus 4.5 和 Gemini 3 Pro 高出约 40%。公开 CUDA-Agent-Ops-6K 数据集与 SKILL.md,但训练好的智能体与权重尚未发布。
