PDF to Markdown API

認証付き POST 1 回で公開 PDF URL を保存済み Markdown に変換——表マージ、見出し正規化、ページ範囲取得に対応。パイプラインと LLM 摂取に。

  • 単一 REST エンドポイント
  • 変換オプション
  • ページング取得
  • 構造化ブロックと Markdown
  • 冪等な課金書き込み
  • 予測可能なエラーコード

リクエスト例

curl -X POST "https://api.agentbody.io/v1/documents/parse" \
  -H "Authorization: Bearer <YOUR_AGENTBODY_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{"analysis_chart":"true","file_name":"YOUR_FILE_NAME","file_url":"YOUR_FILE_URL","merge_tables":"true","recognize_seal":"true","relevel_titles":"true","return_span_boxes":"true"}'

レスポンス例

OpenAPI 仕様に記載されたレスポンス。

Accepted document parse result reference.

{
  "document_id": "00000000-0000-4000-8000-000000000001",
  "get_path": "example_value",
  "pages": 1,
  "preview": "example_value"
}

機能特徴

PDF to Markdown API をドキュメント摂取、RAG パイプライン、コンテンツ移行に使う——URL を入れ、構造化 Markdown を得る。

単一 REST エンドポイント

bearer API キー、file_url、file_name を付けて POST /v1/documents/parse を呼びます。API が文書を変換し document_id を返します。ブラウザ自動化も変換クラスタもホスト不要です。

変換オプション

パースごとに調整できます。merge_tables は断片化した表セルを一貫した表にマージし、relevel_titles は見出し階層を正規化します。analysis_chart や recognize_seal は必要な場合の特殊な文書機能を扱います。

ページング取得

GET /v1/documents/{document_id} で page_start/page_end および markdown_start/markdown_end オフセットを付けて結果を読み戻します。長い PDF も無境界な 1 文字列ではなく、クエリ可能なまま保たれます。

構造化ブロックと Markdown

保存された結果は完全な markdown フィールドと、ページメタデータ付きの構造化ブロックの両方を運びます。ドキュメント検索、RAG のチャンキング、セクションレベルの引用の構築に十分です。

冪等な課金書き込み

パースは従量課金です。再試行時に Idempotency-Key ヘッダーを送ると、中断されたレスポンスが同じ文書の二重課金になりません。同一キーの同一リクエストは元の結果を返します。

予測可能なエラーコード

ドキュメント化されたステータスコードで失敗を処理します。400 は無効なリクエスト、401 はキーの不足または誤り、402 は残高不足、409 は冪等性の競合、502/503/504 は一時的な上流の問題です。

使い方

次のステップで PDF to Markdown API を呼び出します。キーを作成し、文書 URL を送信し、保存された Markdown を読み戻します。

01

API キーを作成

AgentBody アカウントを作成し、コンソールで API キーを生成します。キーはサーバー側に保管し bearer トークンとして送信します。ブラウザコードやクライアントバンドルには決して入れないでください。

02

文書を送信

file_url(公開 HTTPS)と file_name、必要に応じて変換オプションを付けて POST /v1/documents/parse を送信します。レスポンスは document_id と変換プレビューを返します。

03

冪等キーを追加

再試行する可能性のあるすべてのパースに Idempotency-Key ヘッダーを付けます——タイムアウト、接続切断、ワーカー再起動。同一キーの同一リクエストは再課金なしに元の結果を返します。

04

Markdown を読み戻す

GET /v1/documents/{document_id} をページおよび Markdown オフセット付きで呼び、保存された結果を取得します。ページ範囲は大きな文書をナビゲート可能に保ち、オフセットはテキストを正確に切り出します。

05

キーはサーバー側に

バックエンドや定期ジョブからエンドポイントを呼びます。ユーザーが変換をトリガーする場合は、独自エンドポイントでプロキシし、キーと課金を自分の管理下に置いてください。

06

エラーを正しく処理

400 はリクエストを修正し、401 は有効なキーを設定し、402 は残高を補充します。409 はドキュメント化された Idempotency-Key の動作に従います。502/503/504 はバックオフ付きで再試行してください。

よくある質問

PDF to Markdown API とは何ですか?

認証付き REST エンドポイントのペアです。POST /v1/documents/parse が公開 PDF URL を保存済み Markdown に変換し、GET /v1/documents/{document_id} がページ範囲と Markdown オフセット付きで結果を読み戻します。変換オプションには merge_tables と relevel_titles があります。

PDF to Markdown API の料金はどうなっていますか?

各パースはアカウントのクレジットで実行される従量課金の操作です。価格はこのページの固定数値ではなくゲートウェイが管理します。コンソールで現在の費用を確認し、再試行が二重課金にならないよう冪等キーを使ってください。

ローカルファイルを変換できますか?

いいえ。API は公開 HTTPS の file_url を受け付け、multipart アップロードは受け付けません。PDF を API が到達できる場所(オブジェクトストレージ、公開バケット、CDN)にホストし、その URL を file_name とともに渡してください。

特定のページ範囲の Markdown を取得する方法は?

読み取りエンドポイントに page_start と page_end を渡すか、markdown_start と markdown_end で文字オフセットにより切り出します。大きな文書をすべて一度に取得する必要はなく、クエリ可能に保てます。

表や複雑なレイアウトに対応していますか?

表は Markdown 構造として渡されます。merge_tables で断片化した表セルを一貫した表にマージし、relevel_titles で見出し階層を正規化してください。テキストレイヤーのないレイアウトのみのスキャンは対象外で、OCR の約束はありません。

API エラーの処理方法は?

400 はリクエストを修正し、401 は bearer キーを修正し、402 は残高を解決し、409 はドキュメント化された Idempotency-Key の動作に従います。502、503、504 は一時的な上流の障害として、同じキーの下でバックオフ付きで再試行してください。