Experiential 是一个面向智能体工作流的开源网关与路由器,通过一个 OpenAI 兼容 API 统一托管、BYOK 和本地模型。它支持按用户、智能体、用例及预算控制模型访问,并可将生产流量转化为针对质量、速度和成本优化的自定义路由器或模型。项目支持本地部署(pip install experiential)及托管平台,默认启用匿名聚合遥测。
Capability Timeline
模型推理服务
通过托管 API 提供开源或商业模型的在线推理调用,通常兼容 OpenAI 接口
相关工具
68ResceneAgent(Rescene Agent OS)是一款本地优先的开源自迭代智能体操作系统,聚合多家免费模型并提供智能路由与熔断自愈,可用一条 marathon 命令抓取 Hacker News/GitHub 热点自主选题,按需求→计划→自检闭环迭代交付;同时具备联网自学写入记忆文件,以及内置 54 个设计系统参考的前端设计能力。
OpenRouter是面向开发者的大语言模型统一接口平台。它通过单一API密钥即可接入七十余家供应商的四百多款主流模型,开箱兼容OpenAI SDK。平台提供模型路由与数据策略可视化面板,支持在单一供应商宕机时自动降级切换以保障服务高可用。依托边缘网络部署,OpenRouter在保障极低推理延迟的同时优化调用成本。用户按需购买额度即可灵活使用,无需绑定长期订阅
Grok 是由 xAI 构建的 AI 助手,支持聊天对话、图像创建、代码编写,并能从网络和 X 平台获取实时信息回答用户问题。订阅用户可通过 Grok Heavy 等套餐获得 X Premium+ 等增值权益。
OpenAI 是提供多种大模型与 API 服务的 AI 工具平台。本次官方新增能力:开发者可在用量与支出仪表板中按 API 密钥追踪各应用和工作负载的用量与支出,并可为组织或项目设置月度支出限额,包括达到限额即停止流量的硬性上限,帮助企业精细化管控 API 调用成本。
Perplexity Computer 是 Perplexity 官方推出的智能体产品,可将任务拆分给多个子代理(subagents)执行,并支持指定编排模型(orchestrator model)统一调度这些子代理;同时提供定时自动化(scheduled automations)能力,按计划自动运行任务。据官方公告,GPT 5.6 Terra 已成为所有 Computer 子代理的默认模型,Luna 作为定时自动化的主要模型,Terra 亦可作为编排模型使用。
Seedance 2.5 是字节跳动 Seed 团队发布的新一代音视频生成模型,单段视频生成时长提升至 30 秒并支持两次视频延长,延续多模态音视频联合生成架构并强化参考与编辑能力,提供白模控制、绿幕编辑等进阶能力以适配专业视频创作流程,将陆续在即梦 AI、豆包专业版上线,火山方舟 API 也将接入。
SGLang 是由非营利开源组织 LMSYS 托管的大语言模型与多模态模型高性能推理服务框架,面向生产级部署设计,可在单卡到大规模分布式集群之间提供低延迟、高吞吐的推理服务,目前支撑全球超过 40 万块 GPU 上的大规模生产部署,每天生成数万亿 token。
Ante 是 Antigma Labs 推出的自包含终端编码代理,以约 15MB 的单个 Rust 二进制文件分发,零运行时依赖。它以客户端-守护进程架构运行结构化回合循环(提示、工具调用、确认、执行),支持交互式 TUI、无头 CLI 与 ante serve 长驻服务,可自带 API Key 在 12 个以上模型供应商或本地模型间自由切换,并提供多智能体协同、自定义技能、子智能体、MCP 与跨会话持久记忆。
Liquid AI 提供 Liquid Foundation Models(LFM)系列基础模型,主打在手机、笔记本、汽车、可穿戴等设备本地运行的低延迟推理,可在 CPU、GPU、NPU 上通过 llama.cpp、MLX、ONNX、CoreML、vLLM 等运行时部署,并支持针对自有数据与具体场景做微调定制,形成从架构、优化到部署的全栈方案。
通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Cerebras Systems 提供基于晶圆级处理器的 AI 推理与模型服务,主打极低延迟与高吞吐的在线推理能力。2026 年 8 月,Cerebras 与 OpenAI 联合推出 GPT-5.6 Sol Ultrafast(超高速)模式,作为首个在 OpenAI API 上线的新服务层级,由 Cerebras 算力驱动,最高每秒输出 750 个词元、是标准处理的 14 倍且不牺牲模型质量,面向事故响应、金融研究、客服语音交互、电商问答与实时研究等对时延敏感的业务场景,当前以有限预览向一小批客户开放。
Fireworks AI 是由 PyTorch 创始团队打造的生成式 AI 推理与训练云平台,日处理超 40 万亿 token。平台提供 250+ 开源模型(Qwen、Kimi、DeepSeek、MiniMax、GLM、Llama 等)的无服务器与专属部署推理,兼容 OpenAI 与 Anthropic API,支持模型后训练,训练与推理在同一技术栈闭环运行,并具备 SOC 2 Type II、HIPAA、GDPR 合规能力。
GLM 是智谱推出的国产原创大模型全栈技术体系,包含旗舰开源模型 GLM-5.2 及 GLM-5.3,提供全模态大模型 API 服务、Coding 能力、1M 无损上下文和长程任务执行,配套 AutoGLM 智能体、GLM Code 编程与 ChatGPT 对话产品,支持模型微调、AI 搜索与翻译等多场景应用。
GLM-5.3-Flash 是智谱 GLM-5 系列首个原生多模态开源模型,总参 320B、激活参仅 18B,首次采用稀疏+线性注意力混合架构以降低成本服务长上下文。视觉能力原生融入编码循环,可观察界面与渲染结果持续测试改进,并扩展至 Office、金融研究与专业文档工作流,自研拆解目标、调用工具并交付 PPTX/PDF/DOCX/XLSX 成品,支持 1M token 上下文,可经 Z.ai 与 BigModel 调用或本地部署。
GPT-5.6是OpenAI推出的新一代前沿大模型,专注于复杂编程推理与专业知识自动化处理。它能够调用编程工具自主运行轻量程序以协调多步复杂工作流,并支持并行多智能体协同攻关。在专业场景中,GPT-5.6可精准遵循指定模板与参考文件规范,自动整合多平台文档数据并生成高质量演示文稿、财务报表及交互式前端界面,为研发、运营与科研团队提供高成本效益的智能协作支持
Hugging Face 是面向 AI/ML 社区的开源协作平台,用户在 Hub 上托管和协作开发无限的公开模型、数据集与应用(Spaces),并提供 Transformers、Diffusers、Datasets、PEFT、TRL 等开源工具栈。它提供标准化推理:Inference Providers 通过统一 API 访问超 4.5 万模型,Inference Endpoints 支持在专用与自动扩缩容基础设施上部署模型,并提供企业级安全、访问控制与付费按需 GPU Compute。
Perplexity Agent API 是 Perplexity 面向开发者的智能体接口:一次调用即可获得带内置引文的联网检索答案,也可调用 OpenAI、Anthropic、Google、xAI、Z.AI、Moonshot AI、NVIDIA 等第三方模型,并配合 web_search 联网搜索、fetch_url 网页内容抽取、sandbox 代码执行等内置工具与预设,按各服务商原价计费。
QwenCloud 是阿里云推出的统一 AI 开发平台,将模型访问、多模态 API、微调、部署、监控与成本控制整合到一个平台中,面向企业开发者主打企业级可扩展性、可靠性与成本优化。平台提供网站、Skills 与 CLI 三种交互方式:Website 用于人工探索,Skills 支持智能体推理,CLI 用于工作流执行。演示将于 2026 年 9 月 4 日在曼谷的 Qwen Conference 上进行。
国家超算互联网是国家级算力服务平台,连接全国超算智算中心,提供算力调度、应用商城、AI社区及低代码开发环境。平台搭载科学计算智能体,汇聚超万项技能与智能体组件,支持大模型训练与AI推理,为科研院所和个人开发者提供算力、数据、工具全栈配套支撑。
阿里云 AI Gateway 是面向 AI 应用流量入口的云原生网关,统一代理主流大模型与自建模型服务,提供 OpenAI 兼容调用、二级 API Key 签发、多模型灰度与故障转移、Token 配额与限流、大模型内容安全检查、联网搜索结果融合与意图识别,并支持 MCP Server 代理、API 转 MCP 及全链路可观测治理。
Amazon Bedrock 是 AWS 提供的一站式生成式人工智能平台,让企业无需管理底层基础设施即可构建和部署生产级 AI 应用与智能体。平台聚合 Anthropic、Meta、OpenAI、Amazon Nova 等厂商的数百个基础模型,并提供模型选择与评估工具,帮助企业按性能与成本挑选最佳模型。内置 AgentCore 智能体构建与部署能力,同时具备企业级安全与可扩展性,已在全球超过十万家组织投入使用。
AMD ROCm 是 AMD 的开源 GPU 计算开放软件平台,提供编译器、运行时和数学/稀疏/通信库等完整生态,支持 AI、HPC 及领域特定负载,针对 Instinct、Radeon、Ryzen AI 平台优化。ROCm 包含 HIP 运行时、性能分析与调试工具,并通过 PyTorch、JAX、vLLM、SGLang、MIGraphX、ONNX Runtime 等框架支持深度学习训练与 AI 推理,同时提供 ROCm.AI(含 Hyperloom 自主智能体、AMD Skills 技能库与 ROCm CLI)。
AngelSpec 是腾讯混元开源的 torch-native 投机解码框架,用于训练投机解码草稿模型,覆盖自回归 MTP 草稿与 block-parallel DFlash 系列。单一训练管线支持 DFly、DFlash、DFlare、Eagle3、DSpark、MTP 共 6 种草稿架构,切换只需修改配置,并支持 TTT 的 MTP 训练,面向推理加速与部署场景。






