PDF to Markdown API
認証付き POST 1 回で公開 PDF URL を保存済み Markdown に変換——表マージ、見出し正規化、ページ範囲取得に対応。パイプラインと LLM 摂取に。
- 単一 REST エンドポイント
- 変換オプション
- ページング取得
- 構造化ブロックと Markdown
- 冪等な課金書き込み
- 予測可能なエラーコード
リクエスト例
curl -X POST "https://api.agentbody.io/v1/documents/parse" \
-H "Authorization: Bearer <YOUR_AGENTBODY_API_KEY>" \
-H "Content-Type: application/json" \
-d '{"analysis_chart":"true","file_name":"YOUR_FILE_NAME","file_url":"YOUR_FILE_URL","merge_tables":"true","recognize_seal":"true","relevel_titles":"true","return_span_boxes":"true"}'レスポンス例
OpenAPI 仕様に記載されたレスポンス。
Accepted document parse result reference.
{
"document_id": "00000000-0000-4000-8000-000000000001",
"get_path": "example_value",
"pages": 1,
"preview": "example_value"
}機能特徴
PDF to Markdown API をドキュメント摂取、RAG パイプライン、コンテンツ移行に使う——URL を入れ、構造化 Markdown を得る。
単一 REST エンドポイント
bearer API キー、file_url、file_name を付けて POST /v1/documents/parse を呼びます。API が文書を変換し document_id を返します。ブラウザ自動化も変換クラスタもホスト不要です。
変換オプション
パースごとに調整できます。merge_tables は断片化した表セルを一貫した表にマージし、relevel_titles は見出し階層を正規化します。analysis_chart や recognize_seal は必要な場合の特殊な文書機能を扱います。
ページング取得
GET /v1/documents/{document_id} で page_start/page_end および markdown_start/markdown_end オフセットを付けて結果を読み戻します。長い PDF も無境界な 1 文字列ではなく、クエリ可能なまま保たれます。
構造化ブロックと Markdown
保存された結果は完全な markdown フィールドと、ページメタデータ付きの構造化ブロックの両方を運びます。ドキュメント検索、RAG のチャンキング、セクションレベルの引用の構築に十分です。
冪等な課金書き込み
パースは従量課金です。再試行時に Idempotency-Key ヘッダーを送ると、中断されたレスポンスが同じ文書の二重課金になりません。同一キーの同一リクエストは元の結果を返します。
予測可能なエラーコード
ドキュメント化されたステータスコードで失敗を処理します。400 は無効なリクエスト、401 はキーの不足または誤り、402 は残高不足、409 は冪等性の競合、502/503/504 は一時的な上流の問題です。
使い方
次のステップで PDF to Markdown API を呼び出します。キーを作成し、文書 URL を送信し、保存された Markdown を読み戻します。
API キーを作成
AgentBody アカウントを作成し、コンソールで API キーを生成します。キーはサーバー側に保管し bearer トークンとして送信します。ブラウザコードやクライアントバンドルには決して入れないでください。
文書を送信
file_url(公開 HTTPS)と file_name、必要に応じて変換オプションを付けて POST /v1/documents/parse を送信します。レスポンスは document_id と変換プレビューを返します。
冪等キーを追加
再試行する可能性のあるすべてのパースに Idempotency-Key ヘッダーを付けます——タイムアウト、接続切断、ワーカー再起動。同一キーの同一リクエストは再課金なしに元の結果を返します。
Markdown を読み戻す
GET /v1/documents/{document_id} をページおよび Markdown オフセット付きで呼び、保存された結果を取得します。ページ範囲は大きな文書をナビゲート可能に保ち、オフセットはテキストを正確に切り出します。
キーはサーバー側に
バックエンドや定期ジョブからエンドポイントを呼びます。ユーザーが変換をトリガーする場合は、独自エンドポイントでプロキシし、キーと課金を自分の管理下に置いてください。
エラーを正しく処理
400 はリクエストを修正し、401 は有効なキーを設定し、402 は残高を補充します。409 はドキュメント化された Idempotency-Key の動作に従います。502/503/504 はバックオフ付きで再試行してください。
よくある質問
PDF to Markdown API とは何ですか?
認証付き REST エンドポイントのペアです。POST /v1/documents/parse が公開 PDF URL を保存済み Markdown に変換し、GET /v1/documents/{document_id} がページ範囲と Markdown オフセット付きで結果を読み戻します。変換オプションには merge_tables と relevel_titles があります。
PDF to Markdown API の料金はどうなっていますか?
各パースはアカウントのクレジットで実行される従量課金の操作です。価格はこのページの固定数値ではなくゲートウェイが管理します。コンソールで現在の費用を確認し、再試行が二重課金にならないよう冪等キーを使ってください。
ローカルファイルを変換できますか?
いいえ。API は公開 HTTPS の file_url を受け付け、multipart アップロードは受け付けません。PDF を API が到達できる場所(オブジェクトストレージ、公開バケット、CDN)にホストし、その URL を file_name とともに渡してください。
特定のページ範囲の Markdown を取得する方法は?
読み取りエンドポイントに page_start と page_end を渡すか、markdown_start と markdown_end で文字オフセットにより切り出します。大きな文書をすべて一度に取得する必要はなく、クエリ可能に保てます。
表や複雑なレイアウトに対応していますか?
表は Markdown 構造として渡されます。merge_tables で断片化した表セルを一貫した表にマージし、relevel_titles で見出し階層を正規化してください。テキストレイヤーのないレイアウトのみのスキャンは対象外で、OCR の約束はありません。
API エラーの処理方法は?
400 はリクエストを修正し、401 は bearer キーを修正し、402 は残高を解決し、409 はドキュメント化された Idempotency-Key の動作に従います。502、503、504 は一時的な上流の障害として、同じキーの下でバックオフ付きで再試行してください。