OCRテキスト認識サービス

PDF OCR - スキャンしたPDFから瞬時にテキストを抽出

スキャンした、または画像ベースのPDFをアップロードするだけで、数秒で正確な編集可能テキストを取得できます。表、段組み、複数カラムのレイアウトもそのまま保持されます。検索可能なPDF、DOCX、プレーンテキストとして出力できます。

安全な処理 高速な結果 設定不要
99% OCR 精度
Multi-layout ワークフローの品質管理
GDPR 安全なプライベート処理

PDF OCR の特徴

鮮明なスキャンで99%の精度

歴史的な公文書から現代のビジネス文書まで、多様な文書タイプで学習された最先端のAI OCRエンジンです。

表とレイアウトを維持

複数カラムのレイアウト、表、ヘッダー、フッターを検出し、出力文書内で正確に再現します。

検索可能 PDF 出力

透明なOCRテキストレイヤーを持つ検索可能なPDFを取得できます。元の見た目は変わらず、検索やコピー&ペーストが可能です。

DOCX エクスポート

スキャンしたPDFから、書式・段組み・表をそのまま維持した、完全に編集可能なWord文書を作成します。

100+ 言語

ラテン文字、キリル文字、アラビア文字(右横書き)、CJK(中国語・日本語・韓国語)、ヘブライ文字、ギリシャ文字、デーヴァナーガリー文字などに対応しています。

安全でプライベート

すべてのPDFは通信時・保存時ともに暗号化され、処理後は完全削除されます。データは保持されません。

PDF OCRの使い方 - かんたん4ステップ

  1. 1

    スキャンしたPDFをアップロード

    スキャンした、または画像ベースのPDFをアップロードします。ページ数を問わず複数ページの文書に対応し、500MBまでのファイルを受け付けます。

  2. 2

    出力形式を選択

    出力形式として、検索可能なPDF(テキストレイヤー付き)、編集可能なDOCX、プレーンなTXTから選択します。精度を高めるため文書の言語も選択してください。

  3. 3

    OCR 処理します

    AIエンジンがページの傾きを補正し、レイアウトを検出したうえで、100以上の言語でテキストを認識し、表や構造化コンテンツを抽出します。

  4. 4

    結果をダウンロード

    検索可能なPDF、または編集可能なDOCXをダウンロードできます。検索、編集、翻訳、保管にすぐ利用できます。

弊社のPDF OCRサービスを選ぶ理由

スキャンされたPDFは画像であり、検索も選択も編集もできません。ForgeFileのPDF OCRエンジンは、表、複数カラムのレイアウト、ヘッダー、フッターを保持しながらすべての文字を抽出し、検索可能なPDF、編集可能なDOCX、またはプレーンテキストファイルとして結果を出力します。

どのようなPDFをOCRできますか?

  • スキャン文書 - 紙からデジタル化された過去の契約書、請求書、書簡、記録など。
  • 画像ベースのPDF - 文書編集ソフトからの書き出しではなく、画像をPDFとして保存して作成されたPDF。
  • 混在型PDF - 選択可能なテキストページとスキャン画像ページの両方を含むファイル。どちらのタイプも同じジョブ内で処理されます。
  • 複数ページのPDF - どんな長さの文書でも、1回のアップロードで全ページを順に処理します。
  • 回転・傾いたスキャン - 認識前に自動で傾き補正とページ向きの補正を行います。

PDF OCRにForgeFileが選ばれる理由

  • クリーンなスキャンで99%の精度 - 100以上の言語と文書タイプで学習された最先端のAI OCR。
  • 表とカラムの保持 - 行、列、セルの関係性を保ったまま構造化データを抽出。
  • 検索可能なPDF出力 - Ctrl+Fでの検索やコピー&ペーストができる、透明なテキストレイヤー付きPDFを取得できます。元の見た目は変わりません。
  • DOCX出力 - 書式を保持した、完全に編集可能なWord文書を取得できます。
  • 100以上の言語 - ラテン文字、キリル文字、アラビア文字、CJK(中日韓)、デーヴァナーガリー文字などをネイティブに認識。
  • 安全でプライベート - すべてのファイルは暗号化され、処理後に完全に削除されます。

よくある質問 - PDF OCR

PDF OCRはどのようなPDFに対応していますか?

スキャンPDF、画像ベースのPDF、選択可能なページとスキャンページが混在するPDFのいずれにも対応しています。もともとテキスト選択可能なPDFはOCRを行わずそのまま返されます。

どの出力形式に対応していますか?

検索可能なPDF(元の見た目のまま透明なテキストレイヤーを付加)、編集可能なDOCX(書式を保持したWord互換形式)、プレーンなTXTに対応しています。

PDF OCRの精度はどのくらいですか?

300DPI以上の鮮明なスキャンであれば、標準的な印刷文字で99%以上の精度が得られます。手書き文字、低解像度のスキャン、かすれた文字は精度が下がる場合があります。エンジンは複数のフォント、サイズ、スタイルに対応しています。

スキャンしたPDF内の表からデータを抽出できますか?

はい。表の検出機能が行、列、セルの境界を識別します。表は出力先のDOCXで編集可能なWordの表として再現されるほか、リクエストに応じてCSVとして出力することもできます。

対応している言語は?

100以上の言語に対応:ラテン文字を使うすべてのヨーロッパ言語、キリル文字(ロシア語、ウクライナ語、ブルガリア語)、アラビア語・ペルシア語(右横書き)、ヘブライ語、中国語(簡体字・繁体字)、日本語、韓国語、ギリシャ語、タイ語、ヒンディー語(デーヴァナーガリー文字)など。

PDFのプライバシーは守られますか?

はい。アップロードされたPDFはすべて通信時・保存時ともに暗号化され、隔離された環境で処理された後、結果をダウンロードすると即座に完全削除されます。

PDFからテキストを抽出する準備はできましたか?

ForgeFileのPDF OCRを無料でお試しください。クレジットカード不要。スキャンPDFをアップロードすれば、数秒で編集可能なテキストが手に入ります。