ChatGPT是一款人工智能交互平台,能够根据用户保存的聊天记录提供量身定制的回答。该平台支持创建图像、上传文件以及语音对话,并提供深度研究功能。用户登录后可获得个性化服务,其对话内容可能会被审阅并用于改进模型性能
Capability Timeline
复杂推理
模型进行多步逻辑与数学推理、解答竞赛级难题的能力
相关工具
30OpenRouter是面向开发者的大语言模型统一接口平台。它通过单一API密钥即可接入七十余家供应商的四百多款主流模型,开箱兼容OpenAI SDK。平台提供模型路由与数据策略可视化面板,支持在单一供应商宕机时自动降级切换以保障服务高可用。依托边缘网络部署,OpenRouter在保障极低推理延迟的同时优化调用成本。用户按需购买额度即可灵活使用,无需绑定长期订阅
Grok 是由 xAI 构建的 AI 助手,支持聊天对话、图像创建、代码编写,并能从网络和 X 平台获取实时信息回答用户问题。订阅用户可通过 Grok Heavy 等套餐获得 X Premium+ 等增值权益。
OpenAI 是提供多种大模型与 API 服务的 AI 工具平台。本次官方新增能力:开发者可在用量与支出仪表板中按 API 密钥追踪各应用和工作负载的用量与支出,并可为组织或项目设置月度支出限额,包括达到限额即停止流量的硬性上限,帮助企业精细化管控 API 调用成本。
通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Claude Fable 5是专为解决复杂编程与高难度知识工作打造的第五代人工智能模型。它能够处理持续数天的长周期异步任务,自动进行多阶段规划与自我验证。该模型支持深度解析文件与PDF中的图表及表格内容,可自主编写测试代码并校验输出结果,适用于金融、法律、数据分析及架构设计等领域的重度文档处理场景,团队可交付大型项目并直接审核最终成果
GLM 是智谱推出的国产原创大模型全栈技术体系,包含旗舰开源模型 GLM-5.2 及 GLM-5.3,提供全模态大模型 API 服务、Coding 能力、1M 无损上下文和长程任务执行,配套 AutoGLM 智能体、GLM Code 编程与 ChatGPT 对话产品,支持模型微调、AI 搜索与翻译等多场景应用。
GLM-5.3-Flash 是智谱 GLM-5 系列首个原生多模态开源模型,总参 320B、激活参仅 18B,首次采用稀疏+线性注意力混合架构以降低成本服务长上下文。视觉能力原生融入编码循环,可观察界面与渲染结果持续测试改进,并扩展至 Office、金融研究与专业文档工作流,自研拆解目标、调用工具并交付 PPTX/PDF/DOCX/XLSX 成品,支持 1M token 上下文,可经 Z.ai 与 BigModel 调用或本地部署。
GPT-5.6是OpenAI推出的新一代前沿大模型,专注于复杂编程推理与专业知识自动化处理。它能够调用编程工具自主运行轻量程序以协调多步复杂工作流,并支持并行多智能体协同攻关。在专业场景中,GPT-5.6可精准遵循指定模板与参考文件规范,自动整合多平台文档数据并生成高质量演示文稿、财务报表及交互式前端界面,为研发、运营与科研团队提供高成本效益的智能协作支持
Ling-3.0-tiny 是蚂蚁百灵(inclusionAI)开源的轻量级混合推理 MoE 模型,总参数 7.9B,每 token 仅激活 1.3B 参数,采用 KDA 与 MLA 按 3:1 交替堆叠加 128 路由专家的稀疏 MoE FFN。支持快速响应与多步骤推理两种模式,可按请求开关思考模式,在智能体任务、代码、数学与科学推理、长上下文理解上表现均衡,并提供 BF16、FP8、INT4 权重,已在 DGX Spark、Apple Silicon MacBook 与 Mac mini 上验证本地部署。
Apodex 是一家推出专有重型推理大模型的自进化式问题求解器(Self-Evolving Heavy-Duty Solver)实验室,其模型 Apodex 1.1 首次登上 Artificial Analysis,在智能指数上得分 44,与 Kimi K2.6(45)、MiniMax-M3(45)同档,且在同类智力档位中智能体任务表现亮眼。官网将产品定位为面向没有现成答案的难题做深度研究,并逐步推理、逐句核实每个结论后输出可信简报,而非普通聊天回复。
BDH-CQ 是 Pathway 推出的后 Transformer 架构模型(BDH / Dragon Hatchling 家族),在潜在空间中进行循环推理而非依赖思维链。1.5 亿参数版本在 ARC-AGI-1 上取得 29.5% 准确率,每任务推理成本约 0.0007 美元;同架构在 BABILong 长上下文问答中于 32K tokens 达 95%、128K tokens 达 82%,强调测试时的记忆与抽象推理效率。
BigBang-V1 是基于 Qwen3.6-35B-A3B 演化而来的通用智能体模型,总参数 35B、推理时激活约 3B,后训练依靠生成器与评审 Agent 组成的对抗式自演进合成数据框架构造约一万条高难度样本,在长程搜索、软件工程、科学研究与 AI 研究基准上表现突出,并附带含 search、visit、code_exec 的轻量通用智能体 harness。
Claude Sonnet 5 是 Anthropic 于 2026 年 6 月 30 日推出的混合推理模型,具备 100 万 token 上下文窗口,主打编程、工具调用与日常工作场景,并面向实时智能体与高并发任务。用户可在 Claude.ai 的网页、iOS 与 Android 端直接对话使用;开发者可通过 Claude API 调用 claude-sonnet-5,也可在 AWS、Google Cloud 与 Microsoft Foundry 上接入。API 用户还能精细控制模型的思考过程。
DeepSeek 是杭州深度求索公司开发的大语言模型及 AI 助手,网页端、App 与 API 均已上线,支持编程开发、创意写作、文件上传分析与长文本对话,并提供 DeepSeek-V4、R1 等开源模型与开发者 API 平台。
dots3-note preview 是小红书 dots3 系列的首个开源权重模型,采用多模态 MoE 架构,总参数量 280B、激活参数 16B,支持最长 512K token 上下文。模型能理解文本、图像、视频和音频并输出文本,覆盖通用知识与指令遵循、数学与逻辑推理、工具调用与多步 Agent 工作流、代码生成、图像/文档/图表/音频/视频理解以及长上下文处理等任务,是 dots3 系列中延迟与成本最低的轻量成员。
Gemini 3.7 Flash 是 Google DeepMind于2026年8月发布的编码与智能体工作主力多模态模型,定位为大规模智能体任务处理的强算力旗舰。它针对软件工程、Web开发与知识工作任务优化性能,以严谨推理提升输出质量,在智能体执行中能稳定化解编程与真实世界问题,并支持文本、音频、图像、代码与视频的多模态理解。
Gemini 3.8 Flash 是 Google DeepMind 推出的最新工作主力推理与代码模型,在 3.7 Flash 基础上显著提升软件工程、智能体任务与跨领域多步推理能力,常接近更高成本前沿模型表现且保持同等速度与成本。它支持长周期自主编程,在 DeepSWE v1.1 上以极低成本端到端解决复杂工程问题,并在 Vals Finance Agent、Harvey 法律智能体基准上表现优异,通过 Gemini API、AI Studio 与 Android Studio 使用。
IBM Granite 4.2 是 IBM 开源的大语言模型家族,提供 3B、8B、30B 三种稠密规模,基于约 15 万亿 token 训练,支持最长 512K token 上下文,并引入原生推理能力。针对企业智能体工作流,IBM Granite 4.2 具备强工具调用与代码能力,8B/30B 变体经 agentic RL 训练学会自主使用工具、编写运行代码和联网搜索。全部以 Apache 2.0 开源,支持 OpenAI 格式工具调用,可运行于 vLLM 或 SGLang。
Ling-3.0-flash 是蚂蚁百灵(inclusionAI)推出的混合专家(MoE)大模型,总参数约 1240 亿,每 token 激活约 51 亿参数,支持 262144 token 上下文窗口、单次最大输出 32768 token。该模型已上架 OpenRouter,可通过统一 API 免费调用,适合需要长上下文与低成本推理的开发场景。
Maple-Preview 是 DeepGrove 推出的开源 20B-A1B 三值权重推理大模型,采用 24 层、256 专家(8 个激活)与 3:1 SWA-512:GA 注意力结构,专为端侧高效推理设计。检查点仅 5.31GB,支持 131,072 token 上下文,在 M4 Mac mini 上可达 218 tokens/s,能解答 IMO 级数学题,按 MIT 许可发布。
Microsoft Foundry(原 Azure AI Studio)是微软的统一 AI 平台,集成 Foundry Models、Agent Service、Foundry IQ 等能力,支持开发者构建、部署和扩展 AI 应用与多智能体工作流,并提供企业级安全、治理与可观测性,可接入 Azure 应用服务、Fabric、SharePoint 等微软生态及第三方框架。
Muse Glimmer 是 Meta Superintelligence Lab 发布的 300 亿参数因果语言模型,带独立感知编码器,专为消费级硬件上的自主智能体任务打造。它把多步推理、可靠工具调用、图文多模态理解与失败恢复整合进单一模型,可在本地运行而无需云端基础设施或联网,并兼容 OpenClaw、Hermes Agent 等智能体编排框架。
NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 是 NVIDIA Nemotron 3 Ultra 家族的专用编程教师模型,在 Ultra 学生基础上追加编码监督微调与强化学习,具备强算法推理与解题能力,作为 MOPD 多教师蒸馏阶段的领域专家教师之一,也独立用于竞赛编程、算法求解、生成经验证代码与推理链。LatentMoE 架构总参数 550B、激活 55B,支持最长 1M token 上下文,OpenMDW-1.1 许可证允许商用。
