"정확도 99%" 주장은 거의 무의미하다 — 진짜 중요한 것은 이것
대부분의 OCR 제품은 단일 정확도 백분율을 광고하는데, 그 숫자가 실제로 무엇인지 솔직히 말할 필요가 있습니다: 대개는 공개된 벤치마크에 대한 측정이 아니라 마케팅적 결정입니다. 실제 OCR 정확도는 소프트웨어의 고정된 속성이 전혀 아닙니다 — 여러분이 입력하는 특정 이미지나 스캔 자체의 속성입니다. 동일한 엔진이라도 선명하고 고해상도인 비즈니스 편지를 읽을 때와 비스듬히 찍힌 흐릿한 손글씨 메모 사진을 읽을 때는 완전히 다른 결과를 냅니다. 어느 한쪽만 설명할 수 있는 단일 백분율은 존재하지 않습니다. 정말 유용한 것은 그 숫자를 움직이는 요인이 무엇인지 아는 것입니다. 왜냐하면 그중 대부분은 "텍스트 추출"을 클릭하기도 전에 여러분이 직접 통제할 수 있는 것들이기 때문입니다.
OCR이 제대로 작동하는지를 결정하는 네 가지 요소
- 스캔 해상도와 대비 — 저해상도 사진과 흐릿하거나 대비가 낮은 텍스트는 인식 엔진이 아무리 뛰어나도 처리할 수 있는 신호를 줄여버립니다.
- 회전, 기울어짐, 원근 왜곡 — 비스듬히 촬영된 페이지나 살짝 기울어진 스캔은 인식이 시작되기도 전에 글자 경계를 혼동시킵니다.
- 인쇄체와 손글씨 — 손으로 쓴 블록체는 필기체보다 훨씬 일관성이 있으며, 둘 다 대조할 고정된 글자 모양이 없기 때문에 타이핑된 텍스트보다 본질적으로 더 어렵습니다.
- 언어 선택 — 자동 감지는 편리하지만, 문서의 실제 언어를 수동으로 선택하면 엔진이 더 좁고 정확한 문자 집합과 대조할 수 있습니다.
이는 또한 "회전 및 기울어진 텍스트" 보정이 각주가 아니라 실제로 확인 가능한 기능인 이유이기도 합니다. 인식이 시작되기 전에 회전과 원근 왜곡이 보정된 스캔은 인식 단계가 알아서 보완해줄 것이라 기대하는 대신, 위의 네 가지 요인 중 하나를 직접 해결하는 것입니다.
표와 구조화된 레이아웃은 일반 텍스트와는 다른 문제다
일련의 문자가 하나의 단어를 이룬다는 것을 인식하는 것은 OCR 작업의 절반일 뿐입니다. 서식, 청구서, 재무제표에서 나머지 절반은 그 텍스트가 페이지 어딘가가 아니라 특정한 행과 열에 속한다는 것을 인식하는 것입니다. 표 감지는 행, 열, 셀 경계를 식별하고, 표를 서로 연결되지 않은 텍스트 줄로 평탄화하는 대신 그 구조를 스프레드시트나 구조화된 문서로 직접 내보냅니다. 다단 레이아웃도 축소된 형태로 같은 문제를 안고 있습니다. 읽기 순서는 가정이 아니라 추론되어야 하며, 그렇지 않으면 2단 페이지가 양쪽 단의 문장이 뒤섞인 채로 출력됩니다.
올바른 출력 형식을 선택하는 것은 인식 자체만큼이나 중요하다
추출된 텍스트만이 유용한 출력물은 아니며, 잘못된 형식을 선택하면 이미 수행된 인식 작업이 낭비됩니다. 일반 텍스트(TXT)는 스크립트, 번역 도구, 요약 도구에 입력하기에 적합한 선택입니다. 편집 가능한 Word 문서(DOCX)는 추가 편집을 위해 단락 구조를 보존합니다. 검색 가능한 PDF는 원본 스캔을 보이는 그대로 유지하면서 그 아래에 보이지 않는 텍스트 레이어를 추가합니다 — 문서는 여전히 스캔처럼 보이지만, 이제 텍스트를 검색하고 복사해 붙여넣을 수 있습니다. Excel이나 CSV는 일반 텍스트가 아니라 추출된 표에 특히 적합한 대상입니다.
추출 버튼을 누른 후 일어나는 일
- 이미지, 스캔한 PDF, 또는 여러 페이지 문서를 업로드하세요.
- 언어, 출력 형식(TXT, DOCX, 또는 검색 가능한 PDF), 그리고 표 추출이나 손글씨 모드 같은 특수 옵션을 선택하세요.
- 엔진이 기울어짐과 회전을 보정하고, 대비를 개선하며, 선택한 언어에 맞춰 텍스트를 인식합니다.
- 편집 가능한 텍스트, 서식이 있는 문서, 또는 검색 가능한 PDF를 다운로드하세요.
왜 어떤 스캔은 OCR이 더 잘 작동하나요?
정확도는 엔진의 고정된 속성이 아니라 구체적인 입력에 달려 있기 때문입니다 — 스캔 해상도와 대비, 회전이나 기울어짐, 텍스트가 인쇄체인지 손글씨인지, 그리고 어떤 언어가 선택되었는지가 각각 독립적으로 결과에 영향을 미칩니다.
왜 필기체는 블록체 손글씨보다 OCR에 더 어려운가요?
블록체 손글씨는 각 글자를 인쇄체에 더 가까운, 독립적이고 일관된 형태로 유지하는 반면, 필기체 글자는 서로 이어지며 주변 글자에 따라 모양이 달라지기 때문입니다. 이는 위에서 설명한 네 가지 정확도 요인이 민감하게 반응하는 바로 그런 종류의 변동성입니다. 두 방식 모두 동일한 언어에서 지원되지만, 필기체는 비슷한 결과를 얻으려면 더 선명한 스캔이 필요합니다.
왜 다단 페이지가 문장이 뒤섞인 채로 나올 때가 있나요?
읽기 순서는 눈에 보이는 것이 아니라 추론해야 하는 것이기 때문입니다. 표 감지와 다단 처리는 문자 인식과는 별개로 해결됩니다 — 페이지를 단순히 왼쪽에서 오른쪽으로 훑는 대신, 텍스트를 추출하기 전에 행, 열, 셀 경계 또는 단의 순서를 먼저 파악합니다.
검색 가능한 PDF란 무엇이고, 일반 OCR 결과물과 어떻게 다른가요?
검색 가능한 PDF는 원본 스캔 페이지를 보이는 그대로 유지하면서 그 아래에 보이지 않는 텍스트 레이어를 추가합니다 — 문서는 여전히 스캔처럼 보이지만, 이제 텍스트를 검색하고 복사할 수 있습니다.
잘못된 언어를 선택하면 정확도가 떨어지나요?
네. 자동 감지는 편리하지만 엔진에 더 넓고 덜 정밀한 문자 집합을 대조하게 만듭니다. 문서의 실제 언어를 수동으로 선택하면 — 지원되는 14개 이상의 언어 중에서 — 그 문자 집합이 좁아져 특히 글자 모양이 비슷한 언어에서 눈에 띄게 더 정확한 결과를 얻을 수 있습니다.
변환 중 제 스캔 문서는 비공개로 유지되나요?
네. 파일은 전송 및 저장 시 암호화되고, 격리된 환경에서 처리되며, 어떤 모델 학습에도 사용되지 않습니다.
완벽한 스캔이 아니라 실제 스캔에서 텍스트를 추출하세요
스캔한 문서, 사진, 또는 여러 페이지 PDF를 업로드하고 기울어짐 보정, 표 감지, 손글씨 모드를 포함해 인식이 실제로 만들어내는 결과를 확인하세요.
무료로 텍스트 추출하기