PDF 转 Markdown API

一次带鉴权的 POST 把公开 PDF URL 转成存储的 Markdown——支持表格合并、标题规整和按页读取。适用于管线和 LLM 摄取。

  • 单一 REST 端点
  • 转换选项
  • 分页读取
  • 结构化块 + Markdown
  • 幂等的计费写入
  • 可预期的错误码

请求示例

curl -X POST "https://api.agentbody.io/v1/documents/parse" \
  -H "Authorization: Bearer <YOUR_AGENTBODY_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{"analysis_chart":"true","file_name":"YOUR_FILE_NAME","file_url":"YOUR_FILE_URL","merge_tables":"true","recognize_seal":"true","relevel_titles":"true","return_span_boxes":"true"}'

响应示例

来自 OpenAPI 规范的已文档化响应。

Accepted document parse result reference.

{
  "document_id": "00000000-0000-4000-8000-000000000001",
  "get_path": "example_value",
  "pages": 1,
  "preview": "example_value"
}

功能特点

用 PDF to Markdown API 做文档摄取、RAG 管线和内容迁移——URL 进,结构化 Markdown 出。

单一 REST 端点

带 bearer API 密钥、file_url 和 file_name 调用 POST /v1/documents/parse。API 转换文档并返回 document_id——无需托管浏览器自动化或转换集群。

转换选项

逐次解析可调:merge_tables 把碎片化表格单元合并为连贯表格,relevel_titles 规整标题层级;需要时 analysis_chart 和 recognize_seal 处理特殊文档特性。

分页读取

通过 GET /v1/documents/{document_id} 携 page_start/page_end 与 markdown_start/markdown_end 偏移读回结果。长 PDF 保持可查询,而不是一整条无边界字符串。

结构化块 + Markdown

存储结果同时携带完整 markdown 字段和带页元数据的结构化块——足以构建文档搜索、RAG 分块或段落级引用。

幂等的计费写入

解析是按量计费操作。重试时带 Idempotency-Key 头,中断的响应不会让同一文档被重复计费——同键的相同重复请求返回原始结果。

可预期的错误码

用文档化状态码处理失败:400 请求无效、401 密钥缺失或错误、402 余额不足、409 幂等冲突、502/503/504 暂时性上游问题。

使用步骤

按以下步骤调用 PDF to Markdown API:创建密钥,提交文档 URL,读回存储的 Markdown。

01

创建 API 密钥

创建 AgentBody 账号并在控制台生成 API 密钥。密钥留在服务端并以 bearer 令牌发送——绝不放进浏览器代码或客户端包。

02

提交文档

发送 POST /v1/documents/parse,带 file_url(公开 HTTPS)和 file_name,外加需要的转换选项。响应返回 document_id 和转换预览。

03

加幂等键

给每个可能重试的解析附 Idempotency-Key 头——超时、断连、worker 重启。同键的重复相同请求返回原始结果,不重复计费。

04

读回 Markdown

携页码和 Markdown 偏移调用 GET /v1/documents/{document_id} 获取存储结果。页码范围让大文档可导航;偏移精确切分文本。

05

密钥留在服务端

从后端或定时任务调用端点。若由用户触发转换,请经你自己的端点代理,让密钥和计额掌控在你手里。

06

正确处理错误

400 修请求,401 配好密钥,402 充值余额。409 按文档化的幂等键行为处理。502/503/504 带退避重试。

常见问题

PDF to Markdown API 是什么?

一对带鉴权的 REST 端点:POST /v1/documents/parse 把公开 PDF URL 转成存储的 Markdown,GET /v1/documents/{document_id} 按页码范围和 Markdown 偏移读回结果。转换选项含 merge_tables 和 relevel_titles。

PDF to Markdown API 的价格怎么算?

每次解析是消耗账号额度的按量计费操作。价格由网关管理,不在本页写死——在控制台查看当前单价,并用幂等键确保重试不双重计费。

能转换本地文件吗?

不能——API 接受公开 HTTPS file_url,不接受 multipart 上传。把 PDF 托管到 API 可达的位置(对象存储、公开桶、CDN),传该 URL 加 file_name。

怎么取指定页码范围的 Markdown?

读回端点带 page_start 和 page_end,或用 markdown_start 和 markdown_end 按字符偏移切分。大文档无需整份拉取,保持可查询。

支持表格和复杂排版吗?

表格转为 Markdown 结构;开启 merge_tables 合并碎片化表格单元,relevel_titles 规整标题层级。无文本层的纯排版扫描件不在范围内——不做 OCR 承诺。

怎么处理 API 错误?

400 修请求体,401 修 bearer 密钥,402 处理余额,409 按文档化幂等键行为处理。把 502、503、504 当作暂时性上游故障,同键带退避重试。