功能图谱

Capability Timeline

复杂推理

模型进行多步逻辑与数学推理、解答竞赛级难题的能力

30 个工具201 条动态

相关工具

30
CH

ChatGPT是一款支持语音交互与深度研究的AI助手,可基于历史记录提供定制化回答

ChatGPT是一款人工智能交互平台,能够根据用户保存的聊天记录提供量身定制的回答。该平台支持创建图像、上传文件以及语音对话,并提供深度研究功能。用户登录后可获得个性化服务,其对话内容可能会被审阅并用于改进模型性能

安全检测办公协作代码生成对话助手访问控制策略
近7天 10 动态

面向开发者的统一大模型接口,提供多供应商接入、智能路由与边缘加速,实现高效低成本的AI推理调用

OpenRouter是面向开发者的大语言模型统一接口平台。它通过单一API密钥即可接入七十余家供应商的四百多款主流模型,开箱兼容OpenAI SDK。平台提供模型路由与数据策略可视化面板,支持在单一供应商宕机时自动降级切换以保障服务高可用。依托边缘网络部署,OpenRouter在保障极低推理延迟的同时优化调用成本。用户按需购买额度即可灵活使用,无需绑定长期订阅

代码生成对话助手复杂推理模型路由模型推理服务
近7天 6 动态

OpenAI API 平台按密钥追踪用量并设支出上限

OpenAI 是提供多种大模型与 API 服务的 AI 工具平台。本次官方新增能力:开发者可在用量与支出仪表板中按 API 密钥追踪各应用和工作负载的用量与支出,并可为组织或项目设置月度支出限额,包括达到限额即停止流量的硬性上限,帮助企业精细化管控 API 调用成本。

安全检测代码生成复杂推理开放世界3D生成浏览器操作代理
近7天 4 动态

面向高难度知识工作与编程任务的第五代智能模型,支持长周期自主规划与深度推理

Claude Fable 5是专为解决复杂编程与高难度知识工作打造的第五代人工智能模型。它能够处理持续数天的长周期异步任务,自动进行多阶段规划与自我验证。该模型支持深度解析文件与PDF中的图表及表格内容,可自主编写测试代码并校验输出结果,适用于金融、法律、数据分析及架构设计等领域的重度文档处理场景,团队可交付大型项目并直接审核最终成果

安全检测代码审查代码生成对话助手访问控制策略
近7天 2 动态

智谱 GLM-5 系列首个原生多模态开源模型,320B 总参 18B 激活

GLM-5.3-Flash 是智谱 GLM-5 系列首个原生多模态开源模型,总参 320B、激活参仅 18B,首次采用稀疏+线性注意力混合架构以降低成本服务长上下文。视觉能力原生融入编码循环,可观察界面与渲染结果持续测试改进,并扩展至 Office、金融研究与专业文档工作流,自研拆解目标、调用工具并交付 PPTX/PDF/DOCX/XLSX 成品,支持 1M token 上下文,可经 Z.ai 与 BigModel 调用或本地部署。

代码生成复杂推理浏览器操作代理模型推理服务图像理解
近7天 2 动态
GP

GPT-5.6是新一代前沿大模型,支持多智能体并行与自动化编程,专为复杂任务推理与专业知识处理打造

GPT-5.6是OpenAI推出的新一代前沿大模型,专注于复杂编程推理与专业知识自动化处理。它能够调用编程工具自主运行轻量程序以协调多步复杂工作流,并支持并行多智能体协同攻关。在专业场景中,GPT-5.6可精准遵循指定模板与参考文件规范,自动整合多平台文档数据并生成高质量演示文稿、财务报表及交互式前端界面,为研发、运营与科研团队提供高成本效益的智能协作支持

安全检测代码生成复杂推理模型推理服务性能基准
近7天 2 动态

蚂蚁百灵轻量混合推理 MoE 开源模型

Ling-3.0-tiny 是蚂蚁百灵(inclusionAI)开源的轻量级混合推理 MoE 模型,总参数 7.9B,每 token 仅激活 1.3B 参数,采用 KDA 与 MLA 按 3:1 交替堆叠加 128 路由专家的稀疏 MoE FFN。支持快速响应与多步骤推理两种模式,可按请求开关思考模式,在智能体任务、代码、数学与科学推理、长上下文理解上表现均衡,并提供 BF16、FP8、INT4 权重,已在 DGX Spark、Apple Silicon MacBook 与 Mac mini 上验证本地部署。

代码生成复杂推理模型量化压缩模型训练学习性能基准
近7天 2 动态

自我进化式重型问题求解器,逐步推理并核实每个结论

Apodex 是一家推出专有重型推理大模型的自进化式问题求解器(Self-Evolving Heavy-Duty Solver)实验室,其模型 Apodex 1.1 首次登上 Artificial Analysis,在智能指数上得分 44,与 Kimi K2.6(45)、MiniMax-M3(45)同档,且在同类智力档位中智能体任务表现亮眼。官网将产品定位为面向没有现成答案的难题做深度研究,并逐步推理、逐句核实每个结论后输出可信简报,而非普通聊天回复。

复杂推理
近7天 1 动态

自演进合成数据训练的科研智能体模型

BigBang-V1 是基于 Qwen3.6-35B-A3B 演化而来的通用智能体模型,总参数 35B、推理时激活约 3B,后训练依靠生成器与评审 Agent 组成的对抗式自演进合成数据框架构造约一万条高难度样本,在长程搜索、软件工程、科学研究与 AI 研究基准上表现突出,并附带含 search、visit、code_exec 的轻量通用智能体 harness。

代码沙箱执行代码生成复杂推理合成数据生成联网搜索
近7天 1 动态144 Stars

面向实时智能体与高并发工作的混合推理模型

Claude Sonnet 5 是 Anthropic 于 2026 年 6 月 30 日推出的混合推理模型,具备 100 万 token 上下文窗口,主打编程、工具调用与日常工作场景,并面向实时智能体与高并发任务。用户可在 Claude.ai 的网页、iOS 与 Android 端直接对话使用;开发者可通过 Claude API 调用 claude-sonnet-5,也可在 AWS、Google Cloud 与 Microsoft Foundry 上接入。API 用户还能精细控制模型的思考过程。

代码生成对话助手复杂推理函数调用长文本处理
近7天 1 动态

小红书首个全模态 MoE 开源大模型,支持图片/视频/音频理解与长上下文

dots3-note preview 是小红书 dots3 系列的首个开源权重模型,采用多模态 MoE 架构,总参数量 280B、激活参数 16B,支持最长 512K token 上下文。模型能理解文本、图像、视频和音频并输出文本,覆盖通用知识与指令遵循、数学与逻辑推理、工具调用与多步 Agent 工作流、代码生成、图像/文档/图表/音频/视频理解以及长上下文处理等任务,是 dots3 系列中延迟与成本最低的轻量成员。

代码生成复杂推理视频理解图像理解文件分析
近7天 1 动态

谷歌发布的高性能编码与智能体工作主力多模态模型,兼顾深度推理与极速响应

Gemini 3.7 Flash 是 Google DeepMind于2026年8月发布的编码与智能体工作主力多模态模型,定位为大规模智能体任务处理的强算力旗舰。它针对软件工程、Web开发与知识工作任务优化性能,以严谨推理提升输出质量,在智能体执行中能稳定化解编程与真实世界问题,并支持文本、音频、图像、代码与视频的多模态理解。

代码生成复杂推理视频理解图像理解长文本处理
近7天 1 动态

谷歌新一代智能体与编程推理模型,兼顾旗舰级性能与低成本

Gemini 3.8 Flash 是 Google DeepMind 推出的最新工作主力推理与代码模型,在 3.7 Flash 基础上显著提升软件工程、智能体任务与跨领域多步推理能力,常接近更高成本前沿模型表现且保持同等速度与成本。它支持长周期自主编程,在 DeepSWE v1.1 上以极低成本端到端解决复杂工程问题,并在 Vals Finance Agent、Harvey 法律智能体基准上表现优异,通过 Gemini API、AI Studio 与 Android Studio 使用。

代码生成复杂推理智能体
近7天 1 动态

IBM 开源的企业级 Granite 4.2 大语言模型家族

IBM Granite 4.2 是 IBM 开源的大语言模型家族,提供 3B、8B、30B 三种稠密规模,基于约 15 万亿 token 训练,支持最长 512K token 上下文,并引入原生推理能力。针对企业智能体工作流,IBM Granite 4.2 具备强工具调用与代码能力,8B/30B 变体经 agentic RL 训练学会自主使用工具、编写运行代码和联网搜索。全部以 Apache 2.0 开源,支持 OpenAI 格式工具调用,可运行于 vLLM 或 SGLang。

代码生成对话助手复杂推理函数调用智能体
近7天 1 动态

微软统一 AI 平台,构建部署与治理企业级智能体

Microsoft Foundry(原 Azure AI Studio)是微软的统一 AI 平台,集成 Foundry Models、Agent Service、Foundry IQ 等能力,支持开发者构建、部署和扩展 AI 应用与多智能体工作流,并提供企业级安全、治理与可观测性,可接入 Azure 应用服务、Fabric、SharePoint 等微软生态及第三方框架。

复杂推理浏览器操作代理模型推理服务应用构建智能体
近7天 1 动态

Meta 面向本地智能体的 30B 开源模型

Muse Glimmer 是 Meta Superintelligence Lab 发布的 300 亿参数因果语言模型,带独立感知编码器,专为消费级硬件上的自主智能体任务打造。它把多步推理、可靠工具调用、图文多模态理解与失败恢复整合进单一模型,可在本地运行而无需云端基础设施或联网,并兼容 OpenClaw、Hermes Agent 等智能体编排框架。

代码生成复杂推理工具协议集成合成数据生成联网搜索
近7天 1 动态

NVIDIA 面向编程竞赛的领域专家模型,为 Nemotron 3 Ultra 蒸馏供能

NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 是 NVIDIA Nemotron 3 Ultra 家族的专用编程教师模型,在 Ultra 学生基础上追加编码监督微调与强化学习,具备强算法推理与解题能力,作为 MOPD 多教师蒸馏阶段的领域专家教师之一,也独立用于竞赛编程、算法求解、生成经验证代码与推理链。LatentMoE 架构总参数 550B、激活 55B,支持最长 1M token 上下文,OpenMDW-1.1 许可证允许商用。

代码生成复杂推理合成数据生成模型训练学习
近7天 1 动态