PDF 转 JSON

把公开 URL 的 PDF 转成结构化 JSON——每个元素带类型、文本、页码和坐标。免费 AgentBody 账号,浏览器直接运行。

  • 真实结构化 JSON
  • 元素类型保留
  • 页级感知输出
  • 从 URL 出发
  • 附 Markdown
  • Agent 就绪

输入

输出

运行工具后,结果会显示在这里。

功能特点

这款 PDF 转 JSON 转换器的功能,以及它如何服务于数据提取、管线和 LLM 工作流。

真实结构化 JSON

转换返回带类型的块——每块携带 id、元素类型、文本内容、页码和边界框。这是机器可读的结构,不是扁平文本堆砌:字段可直接索引、过滤、存储。

元素类型保留

块带 type 字段区分标题、段落和其他文档元素,下游逻辑可以把标题和正文区别对待,不用自己写解析器。

页级感知输出

每块知道自己的页码,页自带文本层。页级 JSON 和元素级 JSON 并排在同一响应里——按页切,或逐块处理,都行。

从 URL 出发

传入 PDF 的公开 HTTPS URL——报告、发票、公开托管的论文皆可。file_url 加 file_name 就是请求的全部;没有选文件,没有上传步骤。

附 Markdown

同一结果还带文档的 Markdown 渲染——阅读和提示词用干净散文,程序处理用结构化块,一次解析两种形态。

Agent 就绪

本页调用的是你的 agent 也在用的同一个 POST /v1/documents/parse 端点,结果经 GET /v1/documents/{document_id} 读回——这里手动跑,之后 API 自动化,数据完全一致。

使用步骤

按以下步骤把 PDF 转成 JSON:准备 URL,运行解析,读取结构化块。

01

注册免费账号

登录或创建免费的 AgentBody 账号。账号解锁转换并承担额度消耗。

02

复制 PDF 链接

打开要转换的 PDF,复制其公开 HTTPS URL 和文件名。签名过期、内网链接无法解析。

03

填写表单

在本页输入 file_url 和 file_name。可选开启 merge_tables 或 relevel_titles 调节表格和标题的处理方式。

04

运行解析

点击运行。请求发往 POST /v1/documents/parse,返回 document_id——结构化结果存储在你的账号下。

05

读取 JSON

打开存储结果:带 id、type、text、page、bbox 的块与逐页文本一起返回——读回端点支持按页码范围查询。

06

使用结果

把 blocks 数组接进数据库、搜索索引或 LLM 管线。字段跨请求稳定,提取代码写一次持续可用。

常见问题

怎么把 PDF 转成 JSON?

复制 PDF 的公开 HTTPS URL 和文件名,粘贴到本页表单,点击运行。解析存储的结构化结果以 JSON 读回——带文本、页码和位置的类型化块,外加逐页文本。

这是免费的 PDF 转 JSON 转换器吗?

可以免费开始:工具在浏览器里运行,免费 AgentBody 账号即可,每次解析消耗账号额度。价格由网关管理并在控制台展示,不在本页写死。

转换器返回什么 JSON 结构?

一个 blocks 数组,每元素带 id、type、text、page 和 bbox(页上位置),外加带逐页文本的 pages 数组和 markdown 字段。元素级和页级结构一次响应齐全。

怎么把 PDF 书转成 JSON 格式?

用公开 URL 解析一次,然后逐页读回存储结果——page_start 和 page_end 参数让你按范围分批走完一本书,而不是一次拉巨型响应,按自己的节奏拼装完整 JSON。

有免上传的 PDF 转 JSON 转换器吗?

本转换器全程无上传——你只需提供公开 HTTPS URL,工具自己去取文档。免选文件、免上传摩擦:URL 进,结构化块出,每次解析按账号额度计费。

怎么把 PDF 书逐页转成 JSON 格式?

用公开 URL 把书解析一次,然后携 page_start 和 page_end 分页读回存储结果。每块自带页码,章节和小节按你项目需要的粒度拼装成 JSON。

支持扫描版 PDF 吗?

解析器读取带可提取文本层的文档。纯扫描无文本层产不出可用的块——这里不做 OCR 承诺。文本型 PDF 直接转换。

能把 JSON 转回 PDF 吗?

不能——本工具单向,PDF 进 JSON 出。从数据生成 PDF 是另一回事;你自己的渲染管线可以消费本工具产出的 JSON。