网页转 Markdown API

一个 GET 请求把任意公开网页转成干净 Markdown,附带标题、描述与发布时间——无需自建爬虫栈。

  • LLM 友好输出
  • 附带元数据
  • 幂等重试
  • 按成功计费

请求示例

curl "https://api.agentbody.io/v1/scraping/jina-reader?url=YOUR_URL" \
  -H "Authorization: Bearer <YOUR_AGENTBODY_API_KEY>"

响应示例

来自 OpenAPI 规范的已文档化响应。

Readable public web page content.

{
  "content": "example_value",
  "description": "example_value",
  "published_time": "example_value",
  "title": "example_value",
  "url": "https://agentbody.io/"
}

功能特点

为把网页内容喂给 LLM 与流水线而设计。

LLM 友好输出

返回可读 Markdown 而非原始 HTML——直接进提示词和 RAG。

附带元数据

标题、描述、发布时间与规范 URL 随内容一起返回。

幂等重试

幂等键重放已存响应,重试不会二次扣费。

按成功计费

按成功请求结算积分,价格由网关价格表实时治理。

使用步骤

三步拿到干净 Markdown。

01

创建 API key

注册并在控制台生成 key——一分钟内搞定。

02

复制请求示例

拿走自动填好你 key 的 curl、JavaScript、Python、Java 或 Go 示例。

03

接入 Markdown

把内容接进提示词、RAG 索引或 CMS——HTML 噪音已剥离。

常见问题

API 返回什么?

一个 JSON 对象,包含页面标题、描述、发布时间、规范 URL 和 Markdown 内容。

任何 URL 都行吗?

任何公开可访问的 HTTPS 页面。需要登录、私有或仅重定向的 URL 会被拒绝。

如何计费?

按成功请求计费,价格实时读取网关价格表——站点不写死任何单价。

输出是清洗过的吗?

是的——样板与导航噪音已剥离,只留可读 Markdown。

重试会重复扣费吗?

不会。发送幂等键,重试会重放已存响应,不产生第二次扣费。

能解析 PDF 吗?

PDF 与文档解析请用 Documents API——它内置了页码范围检索。