OCRテキスト認識サービス
PDF OCR - スキャンしたPDFから瞬時にテキストを抽出
スキャンした、または画像ベースのPDFをアップロードするだけで、数秒で正確な編集可能テキストを取得できます。表、段組み、複数カラムのレイアウトもそのまま保持されます。検索可能なPDF、DOCX、プレーンテキストとして出力できます。
PDF OCR の特徴
鮮明なスキャンで99%の精度
歴史的な公文書から現代のビジネス文書まで、多様な文書タイプで学習された最先端のAI OCRエンジンです。
表とレイアウトを維持
複数カラムのレイアウト、表、ヘッダー、フッターを検出し、出力文書内で正確に再現します。
検索可能 PDF 出力
透明なOCRテキストレイヤーを持つ検索可能なPDFを取得できます。元の見た目は変わらず、検索やコピー&ペーストが可能です。
DOCX エクスポート
スキャンしたPDFから、書式・段組み・表をそのまま維持した、完全に編集可能なWord文書を作成します。
100+ 言語
ラテン文字、キリル文字、アラビア文字(右横書き)、CJK(中国語・日本語・韓国語)、ヘブライ文字、ギリシャ文字、デーヴァナーガリー文字などに対応しています。
安全でプライベート
すべてのPDFは通信時・保存時ともに暗号化され、処理後は完全削除されます。データは保持されません。
PDF OCRの使い方 - かんたん4ステップ
- 1
スキャンしたPDFをアップロード
スキャンした、または画像ベースのPDFをアップロードします。ページ数を問わず複数ページの文書に対応し、500MBまでのファイルを受け付けます。
- 2
出力形式を選択
出力形式として、検索可能なPDF(テキストレイヤー付き)、編集可能なDOCX、プレーンなTXTから選択します。精度を高めるため文書の言語も選択してください。
- 3
OCR 処理します
AIエンジンがページの傾きを補正し、レイアウトを検出したうえで、100以上の言語でテキストを認識し、表や構造化コンテンツを抽出します。
- 4
結果をダウンロード
検索可能なPDF、または編集可能なDOCXをダウンロードできます。検索、編集、翻訳、保管にすぐ利用できます。
PDF OCR の関連ワークフロー
弊社のPDF OCRサービスを選ぶ理由
スキャンされたPDFは画像であり、検索も選択も編集もできません。ForgeFileのPDF OCRエンジンは、表、複数カラムのレイアウト、ヘッダー、フッターを保持しながらすべての文字を抽出し、検索可能なPDF、編集可能なDOCX、またはプレーンテキストファイルとして結果を出力します。
どのようなPDFをOCRできますか?
- スキャン文書 - 紙からデジタル化された過去の契約書、請求書、書簡、記録など。
- 画像ベースのPDF - 文書編集ソフトからの書き出しではなく、画像をPDFとして保存して作成されたPDF。
- 混在型PDF - 選択可能なテキストページとスキャン画像ページの両方を含むファイル。どちらのタイプも同じジョブ内で処理されます。
- 複数ページのPDF - どんな長さの文書でも、1回のアップロードで全ページを順に処理します。
- 回転・傾いたスキャン - 認識前に自動で傾き補正とページ向きの補正を行います。
PDF OCRにForgeFileが選ばれる理由
- クリーンなスキャンで99%の精度 - 100以上の言語と文書タイプで学習された最先端のAI OCR。
- 表とカラムの保持 - 行、列、セルの関係性を保ったまま構造化データを抽出。
- 検索可能なPDF出力 - Ctrl+Fでの検索やコピー&ペーストができる、透明なテキストレイヤー付きPDFを取得できます。元の見た目は変わりません。
- DOCX出力 - 書式を保持した、完全に編集可能なWord文書を取得できます。
- 100以上の言語 - ラテン文字、キリル文字、アラビア文字、CJK(中日韓)、デーヴァナーガリー文字などをネイティブに認識。
- 安全でプライベート - すべてのファイルは暗号化され、処理後に完全に削除されます。
よくある質問 - PDF OCR
PDF OCRはどのようなPDFに対応していますか?
スキャンPDF、画像ベースのPDF、選択可能なページとスキャンページが混在するPDFのいずれにも対応しています。もともとテキスト選択可能なPDFはOCRを行わずそのまま返されます。
どの出力形式に対応していますか?
検索可能なPDF(元の見た目のまま透明なテキストレイヤーを付加)、編集可能なDOCX(書式を保持したWord互換形式)、プレーンなTXTに対応しています。
PDF OCRの精度はどのくらいですか?
300DPI以上の鮮明なスキャンであれば、標準的な印刷文字で99%以上の精度が得られます。手書き文字、低解像度のスキャン、かすれた文字は精度が下がる場合があります。エンジンは複数のフォント、サイズ、スタイルに対応しています。
スキャンしたPDF内の表からデータを抽出できますか?
はい。表の検出機能が行、列、セルの境界を識別します。表は出力先のDOCXで編集可能なWordの表として再現されるほか、リクエストに応じてCSVとして出力することもできます。
対応している言語は?
100以上の言語に対応:ラテン文字を使うすべてのヨーロッパ言語、キリル文字(ロシア語、ウクライナ語、ブルガリア語)、アラビア語・ペルシア語(右横書き)、ヘブライ語、中国語(簡体字・繁体字)、日本語、韓国語、ギリシャ語、タイ語、ヒンディー語(デーヴァナーガリー文字)など。
PDFのプライバシーは守られますか?
はい。アップロードされたPDFはすべて通信時・保存時ともに暗号化され、隔離された環境で処理された後、結果をダウンロードすると即座に完全削除されます。
PDFからテキストを抽出する準備はできましたか?
ForgeFileのPDF OCRを無料でお試しください。クレジットカード不要。スキャンPDFをアップロードすれば、数秒で編集可能なテキストが手に入ります。