PDF 转 JSON
把公开 URL 的 PDF 转成结构化 JSON——每个元素带类型、文本、页码和坐标。免费 AgentBody 账号,浏览器直接运行。
- 真实结构化 JSON
- 元素类型保留
- 页级感知输出
- 从 URL 出发
- 附 Markdown
- Agent 就绪
输入
输出
运行工具后,结果会显示在这里。
功能特点
这款 PDF 转 JSON 转换器的功能,以及它如何服务于数据提取、管线和 LLM 工作流。
真实结构化 JSON
转换返回带类型的块——每块携带 id、元素类型、文本内容、页码和边界框。这是机器可读的结构,不是扁平文本堆砌:字段可直接索引、过滤、存储。
元素类型保留
块带 type 字段区分标题、段落和其他文档元素,下游逻辑可以把标题和正文区别对待,不用自己写解析器。
页级感知输出
每块知道自己的页码,页自带文本层。页级 JSON 和元素级 JSON 并排在同一响应里——按页切,或逐块处理,都行。
从 URL 出发
传入 PDF 的公开 HTTPS URL——报告、发票、公开托管的论文皆可。file_url 加 file_name 就是请求的全部;没有选文件,没有上传步骤。
附 Markdown
同一结果还带文档的 Markdown 渲染——阅读和提示词用干净散文,程序处理用结构化块,一次解析两种形态。
Agent 就绪
本页调用的是你的 agent 也在用的同一个 POST /v1/documents/parse 端点,结果经 GET /v1/documents/{document_id} 读回——这里手动跑,之后 API 自动化,数据完全一致。
使用步骤
按以下步骤把 PDF 转成 JSON:准备 URL,运行解析,读取结构化块。
注册免费账号
登录或创建免费的 AgentBody 账号。账号解锁转换并承担额度消耗。
复制 PDF 链接
打开要转换的 PDF,复制其公开 HTTPS URL 和文件名。签名过期、内网链接无法解析。
填写表单
在本页输入 file_url 和 file_name。可选开启 merge_tables 或 relevel_titles 调节表格和标题的处理方式。
运行解析
点击运行。请求发往 POST /v1/documents/parse,返回 document_id——结构化结果存储在你的账号下。
读取 JSON
打开存储结果:带 id、type、text、page、bbox 的块与逐页文本一起返回——读回端点支持按页码范围查询。
使用结果
把 blocks 数组接进数据库、搜索索引或 LLM 管线。字段跨请求稳定,提取代码写一次持续可用。
常见问题
怎么把 PDF 转成 JSON?
复制 PDF 的公开 HTTPS URL 和文件名,粘贴到本页表单,点击运行。解析存储的结构化结果以 JSON 读回——带文本、页码和位置的类型化块,外加逐页文本。
这是免费的 PDF 转 JSON 转换器吗?
可以免费开始:工具在浏览器里运行,免费 AgentBody 账号即可,每次解析消耗账号额度。价格由网关管理并在控制台展示,不在本页写死。
转换器返回什么 JSON 结构?
一个 blocks 数组,每元素带 id、type、text、page 和 bbox(页上位置),外加带逐页文本的 pages 数组和 markdown 字段。元素级和页级结构一次响应齐全。
怎么把 PDF 书转成 JSON 格式?
用公开 URL 解析一次,然后逐页读回存储结果——page_start 和 page_end 参数让你按范围分批走完一本书,而不是一次拉巨型响应,按自己的节奏拼装完整 JSON。
有免上传的 PDF 转 JSON 转换器吗?
本转换器全程无上传——你只需提供公开 HTTPS URL,工具自己去取文档。免选文件、免上传摩擦:URL 进,结构化块出,每次解析按账号额度计费。
怎么把 PDF 书逐页转成 JSON 格式?
用公开 URL 把书解析一次,然后携 page_start 和 page_end 分页读回存储结果。每块自带页码,章节和小节按你项目需要的粒度拼装成 JSON。
支持扫描版 PDF 吗?
解析器读取带可提取文本层的文档。纯扫描无文本层产不出可用的块——这里不做 OCR 承诺。文本型 PDF 直接转换。
能把 JSON 转回 PDF 吗?
不能——本工具单向,PDF 进 JSON 出。从数据生成 PDF 是另一回事;你自己的渲染管线可以消费本工具产出的 JSON。