PDF 转 Markdown API
一次带鉴权的 POST 把公开 PDF URL 转成存储的 Markdown——支持表格合并、标题规整和按页读取。适用于管线和 LLM 摄取。
- 单一 REST 端点
- 转换选项
- 分页读取
- 结构化块 + Markdown
- 幂等的计费写入
- 可预期的错误码
请求示例
curl -X POST "https://api.agentbody.io/v1/documents/parse" \
-H "Authorization: Bearer <YOUR_AGENTBODY_API_KEY>" \
-H "Content-Type: application/json" \
-d '{"analysis_chart":"true","file_name":"YOUR_FILE_NAME","file_url":"YOUR_FILE_URL","merge_tables":"true","recognize_seal":"true","relevel_titles":"true","return_span_boxes":"true"}'响应示例
来自 OpenAPI 规范的已文档化响应。
Accepted document parse result reference.
{
"document_id": "00000000-0000-4000-8000-000000000001",
"get_path": "example_value",
"pages": 1,
"preview": "example_value"
}功能特点
用 PDF to Markdown API 做文档摄取、RAG 管线和内容迁移——URL 进,结构化 Markdown 出。
单一 REST 端点
带 bearer API 密钥、file_url 和 file_name 调用 POST /v1/documents/parse。API 转换文档并返回 document_id——无需托管浏览器自动化或转换集群。
转换选项
逐次解析可调:merge_tables 把碎片化表格单元合并为连贯表格,relevel_titles 规整标题层级;需要时 analysis_chart 和 recognize_seal 处理特殊文档特性。
分页读取
通过 GET /v1/documents/{document_id} 携 page_start/page_end 与 markdown_start/markdown_end 偏移读回结果。长 PDF 保持可查询,而不是一整条无边界字符串。
结构化块 + Markdown
存储结果同时携带完整 markdown 字段和带页元数据的结构化块——足以构建文档搜索、RAG 分块或段落级引用。
幂等的计费写入
解析是按量计费操作。重试时带 Idempotency-Key 头,中断的响应不会让同一文档被重复计费——同键的相同重复请求返回原始结果。
可预期的错误码
用文档化状态码处理失败:400 请求无效、401 密钥缺失或错误、402 余额不足、409 幂等冲突、502/503/504 暂时性上游问题。
使用步骤
按以下步骤调用 PDF to Markdown API:创建密钥,提交文档 URL,读回存储的 Markdown。
创建 API 密钥
创建 AgentBody 账号并在控制台生成 API 密钥。密钥留在服务端并以 bearer 令牌发送——绝不放进浏览器代码或客户端包。
提交文档
发送 POST /v1/documents/parse,带 file_url(公开 HTTPS)和 file_name,外加需要的转换选项。响应返回 document_id 和转换预览。
加幂等键
给每个可能重试的解析附 Idempotency-Key 头——超时、断连、worker 重启。同键的重复相同请求返回原始结果,不重复计费。
读回 Markdown
携页码和 Markdown 偏移调用 GET /v1/documents/{document_id} 获取存储结果。页码范围让大文档可导航;偏移精确切分文本。
密钥留在服务端
从后端或定时任务调用端点。若由用户触发转换,请经你自己的端点代理,让密钥和计额掌控在你手里。
正确处理错误
400 修请求,401 配好密钥,402 充值余额。409 按文档化的幂等键行为处理。502/503/504 带退避重试。
常见问题
PDF to Markdown API 是什么?
一对带鉴权的 REST 端点:POST /v1/documents/parse 把公开 PDF URL 转成存储的 Markdown,GET /v1/documents/{document_id} 按页码范围和 Markdown 偏移读回结果。转换选项含 merge_tables 和 relevel_titles。
PDF to Markdown API 的价格怎么算?
每次解析是消耗账号额度的按量计费操作。价格由网关管理,不在本页写死——在控制台查看当前单价,并用幂等键确保重试不双重计费。
能转换本地文件吗?
不能——API 接受公开 HTTPS file_url,不接受 multipart 上传。把 PDF 托管到 API 可达的位置(对象存储、公开桶、CDN),传该 URL 加 file_name。
怎么取指定页码范围的 Markdown?
读回端点带 page_start 和 page_end,或用 markdown_start 和 markdown_end 按字符偏移切分。大文档无需整份拉取,保持可查询。
支持表格和复杂排版吗?
表格转为 Markdown 结构;开启 merge_tables 合并碎片化表格单元,relevel_titles 规整标题层级。无文本层的纯排版扫描件不在范围内——不做 OCR 承诺。
怎么处理 API 错误?
400 修请求体,401 修 bearer 密钥,402 处理余额,409 按文档化幂等键行为处理。把 502、503、504 当作暂时性上游故障,同键带退避重试。