ForHosting KIT · PDF・文書ツール

PDFの指定ページ範囲からテキストを抽出

ページごとのテキストがすでにあり、PDFの特定部分だけが必要な場合に、指定したページ範囲の文章を抽出できます。順序どおりのページブロック、開始ページ、終了ページを指定してください。1から始まる範囲を総ページ数と照合し、両端を含めて選択した文章を可視の改ページマーカーで順番に結合します。レポート、契約書、マニュアルなどの長い文書から、後続処理に全文ではなく必要な部分だけを渡す用途に適しています。

● Beta無料・ブラウザ内で実行
ご利用方法 ウェブAPIメールTelegramアプリ 近日

ページ順のテキストと両端を含む範囲を指定します

PDF抽出ツールまたはOCRが各ページから取得したテキストをご用意ください。元の文書と同じ順番でオブジェクトを並べ、抽出結果が空文字列のページも残します。次に、1から始まるページ番号でstart_pageend_pageを設定してください。両端は範囲に含まれるため、3から5を指定すると3、4、5番目のブロックが返ります。空白ページを削除すると後続の番号がずれるため、そのまま保持することが重要です。各ページはtext文字列を持つオブジェクトでなければならず、欠落値や異なる型は拒否されます。最大で1万ページのブロックを入力できます。この機能はPDFファイル自体を開いたり解析したりせず、前段で取得済みのページ別テキストのみを扱います。そのため、選択条件が明確で、結果を予測しやすくなります。

範囲の検証とページ境界をご確認ください

ページ番号は1から始まり、開始と終了の両方を含めて厳密に検証されます。両方とも1以上の整数である必要があり、開始ページを終了ページより後にはできません。また、どちらも入力されたページブロック数を超えられません。3ページの文書で終了を4にすると、部分的な結果ではなく入力エラーが返ります。これにより、文書情報、利用者の指定、抽出結果の食い違いを確実に検出できます。選択された文字列は、前後に空行を置いた一定のマーカーで結合され、本文の切り詰めや解釈は行いません。1ページだけの場合は境界がないためマーカーもありません。出力には選択ページ数と受理した開始・終了番号も含まれます。ネットワーク、乱数、時刻、言語モデル、推論を使わないため、同じ入力からは常に同じ結果が得られます。

対象を絞った文書処理に組み込めます

この選択処理は、ページ構造を保つ抽出工程と、文書全体を必要としない後続工程の間で特に役立ちます。契約書の別紙だけを条項解析へ渡したり、四半期報告書の経営説明部分だけを比較対象にしたり、製品マニュアルの1章だけを検索用に登録したりできます。バイナリPDFではなくテキストを受け取るため、スキャン文書のOCRにも、デジタル文書の通常抽出にも組み合わせられます。範囲を検証するまでは元の配列を保持し、監査が必要な場合は返された開始・終了番号も記録してください。改ページマーカーは引用のために残すことも、後から分割することもできます。この機能は要約、修正、分類、正規化を行いません。それらを別工程に分けることで、正確な振り分けに使える決定的で再現可能な基本処理として利用できます。

レポートの一部を切り出します

経営説明を含むページだけを選び、分析や比較の工程へ渡せます。

契約書の別紙を振り分けます

別紙を含む範囲だけを抽出し、確認に必要なページ境界を保持できます。

マニュアルの章を登録します

ページ別テキストから1章を選び、検索やサポート向けに送信できます。

開始ページと終了ページは含まれますか?

はい。両端を含むため、2から4を指定すると3ページ分のテキストブロックが返ります。

範囲が文書を超えるとどうなりますか?

どちらかの端が入力ページ数を超えた場合は、入力エラーを返します。

PDFファイルそのものを読み込みますか?

いいえ。PDFから事前に抽出された、順序付きのページ別テキストを受け取ります。

選択したページはどのように区切られますか?

隣接するページ文字列を、前後に空行のある一定の改ページマーカーで結合します。

1回の利用料金はいくらですか?

API料金は1リクエストあたり$0.002です。機能ページでは決定的な処理をブラウザで無料実行できます。

このページの機能はすべてAPIからも利用できます。自社システムに組み込みたいチーム向けのセクションです。それ以外の方は上のツールをそのままお使いください。

POSThttps://api.kit.forhosting.com/pdf/text-extract-by-page-range

Bearerトークンで認証し、POST1回でタスクをキューに登録します。結果はWebhookまたは署名付きリンクで受け取れます。

curl -X POST https://api.kit.forhosting.com/pdf/text-extract-by-page-range \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pages":[{"text":"Cover page"},{"text":"Executive summary\nRevenue increased."},{"text":"Risk analysis\nSupply remains constrained."},{"text":"Appendix"}],"start_page":2,"end_page":3}'
{
  "pages": [
    {
      "text": "Cover page"
    },
    {
      "text": "Executive summary\nRevenue increased."
    },
    {
      "text": "Risk analysis\nSupply remains constrained."
    },
    {
      "text": "Appendix"
    }
  ],
  "start_page": 2,
  "end_page": 3
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.text_extract_by_page_range",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

非同期APIです。task_idは即時に返ります。ポーリングは1秒あたり1リクエストまでです。

1リクエストあたり$0.002

単価はすべて公開しています。トークン換算や独自クレジットはありません。失敗したタスクは課金されません。

max_mb25
max_pages200
HTTPコード意味
401unauthorizedAPIキーが無効か、指定されていません。Authorizationヘッダーを確認してください。
402insufficient_balance残高が不足しています。チャージ後に再度お試しください。
404unknown_type指定されたタスクタイプは存在しません。タイプ名を確認してください。
429rate_limitedリクエストが多すぎます。しばらく待ってから再度お試しください。

KITの完全なドキュメントを見る →