「精度99%」という主張はほぼ無意味——本当に重要なのはこちら
ほとんどのOCR製品は単一の精度パーセンテージを宣伝していますが、その数値が実際に何であるかについて正直になる価値があります。それは通常、公開されたベンチマークに対する測定結果ではなく、マーケティング上の判断です。実際のOCR精度は、そもそもソフトウェアの固定的な性質ではまったくありません——入力する特定の画像やスキャンそのものの性質です。同じエンジンでも、鮮明で高解像度のビジネスレターを読む場合と、斜めに撮影された手書きメモのぼやけた写真を読む場合とでは、まったく異なる結果になり、どちらか一方だけを説明できる単一のパーセンテージは存在しません。本当に役立つのは、その数値を動かす要因を知ることです。なぜなら、そのほとんどは「テキストを抽出」をクリックする前にあなた自身がコントロールできるものだからです。
OCRが正しく機能するかどうかを決める4つの要素
- スキャンの解像度とコントラスト——低解像度の写真や薄い文字・低コントラストの文字は、認識エンジンがどれほど優れていても、処理できる手がかりを減らしてしまいます。
- 回転・傾き・遠近歪み——斜めに撮影されたページや、わずかに傾いたスキャンは、認識が始まる前から文字の境界を混乱させます。
- 活字か手書きか——ブロック体の手書き文字は筆記体よりもはるかに一貫性があり、両者とも、比較対象となる固定の文字形状が存在しないため、活字よりも本質的に難しくなります。
- 言語の選択——自動検出は便利ですが、文書の実際の言語を手動で選択すると、エンジンはより狭く精度の高い文字セットと照合できます。
これは、「回転・傾いたテキスト」の補正が単なる注釈ではなく、実際に確認可能な機能である理由でもあります。認識が始まる前に回転と遠近歪みを補正されたスキャンは、上記4つの要因のうちの1つを直接解決しているのであって、認識ステップ自体が十分賢く補ってくれることを期待しているわけではありません。
表や構造化されたレイアウトは、単純なテキストとは別の問題
文字の集まりが単語を形成していると認識することは、OCRの仕事の半分に過ぎません。もう半分——フォーム、請求書、財務諸表において——は、そのテキストがページ上のどこかにあるだけでなく、特定の行と列に属していると認識することです。表の検出は行・列・セルの境界を識別し、その構造をばらばらのテキスト行に平坦化するのではなく、スプレッドシートや構造化された文書に直接書き出します。多段組みレイアウトにも同様の問題が縮小版として存在します。読み順は仮定するのではなく推測しなければならず、そうしないと2段組みのページから両方の段の文が入り混じって出力されてしまいます。
正しい出力形式を選ぶことは、認識そのものと同じくらい重要
抽出されたテキストだけが有用な出力ではなく、間違った形式を選ぶと、すでに行われた認識作業を無駄にしてしまいます。プレーンテキスト(TXT)は、スクリプトや翻訳ツール、要約ツールに読み込ませるのに適した選択です。編集可能なWord文書(DOCX)は、さらなる編集のために段落構造を保持します。検索可能なPDFは元のスキャンを見た目そのままに保ちながら、その下に目に見えないテキスト層を追加します——文書はスキャンのように見えたままですが、今やテキストを検索したりコピー&ペーストしたりできます。ExcelやCSVは、一般的なテキストではなく、抽出された表専用の正しい出力先です。
「抽出」をクリックした後に起こること
- 画像、スキャンされたPDF、または複数ページの文書をアップロードします。
- 言語、出力形式(TXT、DOCX、検索可能なPDF)、そして必要に応じて表抽出や手書きモードなどの特別なオプションを選択します。
- エンジンが傾きと回転を補正し、コントラストを強化し、選択された言語に基づいてテキストを認識します。
- 編集可能なテキスト、書式付き文書、または検索可能なPDFをダウンロードします。
なぜOCRはスキャンによって精度が異なるのですか?
精度はエンジンの固定的な性質ではなく、特定の入力に依存するからです——スキャンの解像度とコントラスト、回転や傾き、テキストが活字か手書きか、そして選択された言語が、それぞれ独立して結果に影響します。
なぜ筆記体はブロック体の手書き文字よりもOCRにとって難しいのですか?
ブロック体の手書き文字は、活字に近い形で各文字を独立した一貫性のある形として保つのに対し、筆記体の文字は互いにつながり合い、隣接する文字によって形が変化するためです。これはまさに、上記の4つの精度要因が敏感に反応する種類のばらつきです。両者とも同じ言語で対応していますが、筆記体で同程度の結果を得るには、より鮮明なスキャンが必要です。
なぜ複数段組みのページが、文が入り混じった状態で出力されることがあるのですか?
読み順は目で見て分かるものではなく、推測しなければならないからです。表の検出と複数段組みの処理は、文字認識とは別に解決されます——ページを単純に左から右へ走査するのではなく、テキストが抽出される前に、まず行・列・セルの境界、あるいは段の順序が識別されます。
検索可能なPDFとは何ですか?通常のOCR出力とどう違いますか?
検索可能なPDFは、元のスキャンされたページの見た目をそのまま保ちながら、その下に目に見えないテキスト層を追加します——文書はスキャンのように見えたままですが、今やそのテキストを検索したりコピーしたりできます。
言語の選択を間違えると精度は下がりますか?
はい。自動検出は便利ですが、エンジンに照合させる文字セットがより広く、精度の低いものになってしまいます。文書の実際の言語を手動で選択する——14+の対応言語の中から——ことで、その文字セットが絞り込まれ、特に文字の形が似ている言語において、測定可能なほど精度の高い結果が得られます。
スキャンした文書のプライバシーは守られますか?
はい。ファイルは転送中・保存中ともに暗号化され、隔離された環境で処理され、いかなるモデルの学習にも使用されません。
完璧なスキャンではなく、実際のスキャンからテキストを抽出しよう
スキャンした文書、写真、または複数ページのPDFをアップロードして、傾き補正・表検出・手書きモードを含む認識結果を実際に確認してください。
無料でテキストを抽出