功能图谱

Capability Timeline

网页抓取提取

抓取网页并把 HTML 转为干净的 Markdown/JSON 结构化内容,用于 RAG 与数据采集

4 个工具35 条动态

相关工具

4

本地优先的自迭代智能体操作系统

ResceneAgent(Rescene Agent OS)是一款本地优先的开源自迭代智能体操作系统,聚合多家免费模型并提供智能路由与熔断自愈,可用一条 marathon 命令抓取 Hacker News/GitHub 热点自主选题,按需求→计划→自检闭环迭代交付;同时具备联网自学写入记忆文件,以及内置 54 个设计系统参考的前端设计能力。

安全检测代码沙箱执行访问控制策略联网搜索浏览器操作代理
近7天 7 动态74 Stars

联网检索型智能体模型调用 API

Perplexity Agent API 是 Perplexity 面向开发者的智能体接口:一次调用即可获得带内置引文的联网检索答案,也可调用 OpenAI、Anthropic、Google、xAI、Z.AI、Moonshot AI、NVIDIA 等第三方模型,并配合 web_search 联网搜索、fetch_url 网页内容抽取、sandbox 代码执行等内置工具与预设,按各服务商原价计费。

代码沙箱执行联网搜索模型推理服务网页抓取提取智能体
近7天 2 动态

将公开网页转换为 Markdown/JSON 供 AI 使用的内容提取 API

Messora 是一款网页内容提取 API,接收公开 URL 并返回干净 Markdown、按 schema 结构化的 JSON 或原始 HTML,避免把大量无关的 HTML 标记、导航和脚本喂给大模型,显著节省上下文 token。官方提供免费账号与每月 1000 额度积分,无需信用卡,并有无需注册的在线 playground 供测试。当前处于 founder beta,LinkedIn/Instagram 及强反爬目标会被拒绝或受限,暂未提供官方 SDK,仅通过 REST API 调用。

结构化抽取网页抓取提取
近7天 1 动态

开源网页抓取与内容提取 API

SparkFetch 是一个开源、可自托管的网页抓取与内容提取 API,使用 TypeScript 与 Node.js 构建。它能把杂乱的 HTML 转换为干净的 Markdown、结构化 JSON 或纯文本,提供 scrape 单页抓取、crawl 递归爬取(支持深度与路径排除)、map 域名 URL 发现三类接口,并自动剥离导航、广告与模板内容,适用于 AI 应用、RAG 检索管线、研究自动化、内容监控与文档索引等场景。

网页抓取提取
近7天 1 动态48 Stars