Kimi K3 是月之暗面推出的 AI 助手,专为智能体编程与知识工作打造。支持 Swarm 智能体集群与 Goal 模式并行执行任务,可构建可玩的多人与3D游戏,生成咨询级 PPT,处理 Excel 和 PDF 文档,提供深度研究与建站能力。
Capability Timeline
图像理解
识别、描述和分析用户上传图片中的文字、对象、结构与视觉信息。
相关工具
34Claude 是由 Anthropic 开发的 AI 助手,专为应对复杂挑战与高效工作协同而设计。它能够协助开发者完成代码编写、调试与逻辑优化,并提供深度的数据分析与可视化图表生成服务。用户可通过自然语言直接下达指令、上传复杂文档进行智能解析,或连接外部数据源。Claude 支持设定每日、每周或每月定时任务,自动产出格式化的报告、演示文稿或电子表格,实现从问题拆解到自动化交付的全流程协同
Kimi 是月之暗面推出的 AI 助手,核心产品 Kimi K3 为全球首个开源 3T 级模型,具备 2.8T 参数、原生视觉能力与百万 Token 上下文窗口。支持实时联网搜索、50+ 文件分析、AI 幻灯片与网站生成、前沿编程能力及增强图像理解,适用于长程编程、知识工作与推理任务。
Bonsai 27B 是 PrismML 发布的开源多模态模型,基于 Qwen3.6 27B。提供三元(5.9GB)和1-bit(3.9GB)两个变体,后者首次将27B级模型装入 iPhone 17 Pro。支持多步推理、结构化工具调用、视觉任务和智能体循环,262K上下文窗口,支持推测解码。三元变体保留全精度95%性能,1-bit保留90%,数学与编码能力几乎无损。Apache 2.0开源。
阿里云EMR Serverless Spark是面向数据与AI场景的高性能湖仓服务,基于开源Spark生态构建,提供端到端数据平台服务,包括作业开发、调试、调度和运维。内置Fusion Engine性能比开源Spark提升300%,支持存算分离与按量付费,显著简化数据处理和模型训练流程。
Gemini 3.5 Flash 是一款面向智能体与编程领域的前沿多模态AI模型。它能够在极速响应下提供媲美旗舰模型的智能水平,支持文本、音频、图像、代码和视频的深度融合理解。该模型擅长长周期任务的自主推理与多智能体协同调度,可在编码迭代中快速生成并优化界面,同时具备针对提示注入等网络威胁的主动拦截能力。凭借百万级长上下文支持与企业级安全标准,它为开发者构建高效自动化工作流提供核心支持
Gemini 3.6 Flash 是 Google DeepMind 推出的高效主力模型,面向编码、知识工作与多模态任务,相比 3.5 Flash 输出 token 用量降低约 17%。模型支持跨文本、音频、图像、代码与视频的多模态理解,具备长周期深度推理与迭代编码能力,可通过多智能体编排执行代码迁移、财务数据分析等复杂任务,并已上线 Google AI Studio 与 Gemini API。
通义千问(Qwen)是阿里巴巴云开发的大语言模型系列,提供对话助手、代码生成、智能体工具调用、256K至100万token长文本理解、多语言翻译和创意写作等能力。模型涵盖Dense和MoE架构,支持思考与非思考模式切换,可通过Qwen Chat、API及多种推理框架使用。
Apple Intelligence 是苹果全平台 AI 系统,深度集成于 iOS、iPadOS、macOS 和 visionOS。提供 Genmoji 表情生成、Siri 智能助手、图像理解与描述、HomeKit 视频摘要、无障碍辅助、Workout Buddy 运动指导等能力。采用设备端处理与 Private Cloud Compute 保护隐私,通过 Foundation Models 框架向第三方应用开放 AI 能力。
Claude Fable 5是专为解决复杂编程与高难度知识工作打造的第五代人工智能模型。它能够处理持续数天的长周期异步任务,自动进行多阶段规划与自我验证。该模型支持深度解析文件与PDF中的图表及表格内容,可自主编写测试代码并校验输出结果,适用于金融、法律、数据分析及架构设计等领域的重度文档处理场景,团队可交付大型项目并直接审核最终成果
Fudge MCP 是一款面向 AI 编码代理的设计参考引擎。它收录近 10,000 个真实生产网站的截图,支持按字体、颜色、组件、布局、页面类型和视觉相似度进行搜索。Fudge MCP 通过 MCP 在本地运行,搭配 Chrome 扩展保存和管理设计参考,帮助编码代理获取具体设计依据而非模糊形容词,从而生成更高质量的用户界面。
Google 搜索中的视觉搜索与图像生成功能
Google Images 是 Google 搜索引擎中的视觉搜索功能模块,提供从网络搜索图片、以图搜图、Google Lens 实时识别等功能。25周年更新中推出可浏览图片主页,展示动态沉浸式图片画廊并按用户兴趣智能定制;同时将图像生成直接引入 AI Overviews,基于 Nano Banana 模型将文本提示词转化为高质量定制图像。
Grok 是由 xAI 构建的 AI 助手,支持聊天对话、图像创建、代码编写,并能从网络和 X 平台获取实时信息回答用户问题。订阅用户可通过 Grok Heavy 等套餐获得 X Premium+ 等增值权益。
Inkling 是 Thinking Machines Lab 发布的首个开源权重 MoE 模型,总参数量975B、活跃参数41B,支持100万token上下文窗口。模型原生支持文本、图像和音频理解,具备代码生成、智能体工具调用等能力,可通过 Tinker 平台进行微调定制。
MiniCPM-Robot 是面壁智能(OpenBMB)面向真实世界感知、决策与行动的开源具身智能模型系列。首批包含 1.5B 通用机器人操作 VLA 模型 MiniCPM-RobotManip,一套权重覆盖下游任务并支持流式上下文记忆;以及 0.9B 纯端侧具身目标跟踪方案 MiniCPM-RobotTrack,覆盖静态、动态与对抗目标。配套 PhyAI 推理框架在 NVIDIA H20 上将推理帧率从 10 Hz 提升至 37 Hz。
MiniMax M3 是 MiniMax 自研的前沿大语言模型,采用全新注意力架构 MSA(MiniMax Sparse Attention),支持最高 1M tokens 上下文窗口。模型具备编码、智能体、多模态理解等能力,可自主完成论文复现、CUDA 算子优化等长线程任务。M3 已在 HuggingFace 和 GitHub 开源,支持私有集群部署和微调,同时通过 API、Token Plan 订阅和 MiniMax Code 平台向开发者开放。
Nativ 是一款 macOS 桌面应用,基于 MLX-VLM 针对 Apple Silicon(M1+)优化,让用户无需账户、订阅或云端即可在本地运行 Google、Cohere、Liquid AI 等开放模型。应用支持语言、视觉、视频、代码、音频等多模态交互,提供实时 tokens/秒、内存压力、首 token 延迟等性能指标,并内置本地端点,可对接 Codex、Claude Code、OpenCode 等编码智能体。项目以 MIT 许可完全开源。
NVIDIA Cosmos 是一个开源的物理 AI 基础世界模型平台,包含 Cosmos 3 基础版及 Cosmos 3 Edge 等模型。它可作为视觉语言模型对复杂真实场景中的物体、交互和意图进行推理,支持质量检测、公共安全、交通监控、物流和自动驾驶等实时告警与密集描述。同时可加速机器人策略学习,作为世界动作模型骨干适配特定任务和领域行为;还可作为可控的物理世界模拟器预测多种方案并闭环评估结果;并支持从文本、图像、视频、环境声音和动作输入生成无限合理的合成视频数据,用于训练物理 AI。
NVIDIA 的实时流分析工具包,用于 GPU 加速的视频与图像智能处理
NVIDIA DeepStream SDK 是一个基于 GStreamer 的开源实时流分析工具包,专为 AI 驱动的多传感器处理、视频、音频和图像理解而设计。它提供硬件加速解码/编码、TensorRT 推理、目标追踪和消息代理集成,支持 dGPU 和 Jetson 边缘设备部署。开发者可通过 Agent 技能用自然语言自动生成多摄像头视频分析管道,大幅缩短开发周期。
Pantograph 推出的首个目标条件强化学习模型,通过互联网规模视频预训练学习目标导向行为。Pan-4B 拥有40亿参数,在约50万小时 Minecraft 视频上预训练,再经约2000小时承包商轨迹后训练。模型能根据目标图像指令在 Minecraft 中战斗、探索、建造和完成平台跳跃任务,并可泛化到未见过的环境。
Project N.E.K.O.(猫娘计划)是哔哩哔哩在WAIC 2026展示的开源AI数字生命生态计划,核心产品为主动式、原生全模态AI伙伴驱动器N.E.K.O.。支持Live2D与VRM双引擎,用户可自由导入二次元角色、原创角色和虚拟主播模型;内置视觉多模态大模型可理解电脑屏幕内容并主动发起对话。采用前端UI、AgentAI大脑、Memory记忆系统分离式架构,核心数据可完全保留在本地。已在Steam上架抢鲜体验,GitHub Star数突破2K。
Siri是苹果的智能语音助手,在iOS 27中升级为AI驱动的新版本。它能访问用户设备上的邮件、照片和信息,感知屏幕内容,回答世界知识问题,并集成Spotlight搜索。新版Siri基于Apple Intelligence的Foundation Models在设备端运行,结合Private Cloud Compute保障隐私数据不被存储,支持iPhone、iPad、Mac、Apple Watch、AirPods、Apple TV和Vision Pro等全平台,并首次提供独立应用入口。
Token Plan 是阿里千问 AI 平台推出的模型订阅套餐,提供个人版与团队版,用户在统一订阅体系下通过一个 API Key 调用文本、语音、图像等全模态模型能力,抢先体验 Qwen3.8-Max-Preview 等先进模型。套餐按 Credits 计量,兼容 OpenAI / Anthropic 协议的主流 Coding 与 Agent 工具,支持联网搜索、知识检索等工具能力,并可同时运行多个 Agent 并发任务。
TuringViT 是小鹏基础模型团队发布的高效视觉 Transformer 编码器,通过 Turing 线性注意力架构、VISTA-Curation 数据治理流水线与原生动态分辨率训练,仅用主流基线 10% 的图文数据即可达到 SOTA 级零样本性能,并在高分辨率输入下显著降低推理延迟。提供 18L 与 24L 两个规格,面向 VLM/VLA 下游场景,支撑智能驾驶、智能座舱与 IRON 人形机器人感知。





