PDF OCR 방법 (검색 가능하게 만들기)
스캔한 PDF를 OCR로 검색 가능하게 만드는 단계별 가이드: 문서 언어를 선택하면 브라우저에서 로컬로 텍스트 레이어가 추가되며 파일은 업로드되지 않습니다.
텍스트 인식스캔한 PDF는 텍스트를 찍은 사진과 같습니다. 읽을 수는 있어 보이지만 검색창, 복사-붙여넣기, 텍스트 추출기 입장에서는 페이지가 비어 있는 것과 같습니다. OCR(광학 문자 인식)은 글자를 인식해 스캔 위에 보이지 않는 텍스트 레이어를 추가함으로써 이 문제를 해결합니다. 이 가이드에서는 AmiPDF의 OCR PDF 도구로 이를 수행하는 방법을 보여줍니다. 이 도구는 인식 전 과정을 브라우저에서 실행하므로 파일이 기기를 떠나지 않으며, 이는 계약서, 의료 기록, 신분증 문서에서 중요한 점입니다. 문서 언어를 하나 이상 선택하면 도구가 각 페이지를 인식하고, 결과물은 동일한 PDF이지만 이제 검색과 복사가 가능합니다.
단계별 OCR 실행
OCR 도구를 열고 스캔 파일 추가
AmiPDF OCR PDF 도구로 이동해 스캔한 PDF를 업로드 영역에 끌어다 놓습니다. 도구의 페이지 제한 내에 있는 스캔 문서를 사용할 수 있습니다. 스캔한 파일이 긴 책이라면 먼저 PDF 분할로 나눈 뒤 각 부분을 처리하세요.

문서 언어 선택
문서에 나타나는 모든 언어를 실행당 제한까지 선택합니다. 텍스트에 실제로 여러 언어가 섞여 있다면 두세 개 언어를 선택하는 편이 인식률을 높여 줍니다. 문서에 없는 언어를 추가하면 실행 속도만 느려집니다. 엔진과 언어 팩은 처음 사용할 때 한 번 다운로드되고 이후에는 캐시됩니다.

인식 실행
시작을 클릭하고 페이지별 진행 상황을 확인합니다. 인식은 WebAssembly를 통해 기기에서 실행됩니다. 10페이지 스캔은 보통 기기 성능에 따라 몇 분 정도 걸립니다. 실행이 끝날 때까지 탭을 열어 두세요. 도구가 결과물을 자동으로 조립합니다.

검색 가능한 PDF 다운로드
결과를 저장합니다. 시각적으로는 같은 문서이지만 이제 아래에 보이지 않는 텍스트 레이어가 있습니다. 어떤 PDF 리더에서도 검색이 작동하고, 복사-붙여넣기 시 실제 텍스트가 나오며, 나중에 PDF to Markdown으로 내용을 추출할 수도 있습니다. 버튼을 누르면 인식된 원본 텍스트를 .txt 파일로도 받아 빠르게 확인할 수 있습니다.

최상의 결과 얻기
깨끗한 스캔일수록 인식률이 높습니다
반듯하고 조명이 고르며 300 DPI인 페이지가 가장 좋습니다. 기울어진 휴대폰 사진은 가장자리에서 정확도가 떨어집니다. 원본이 휴대폰 카메라 사진이라면 먼저 반듯하게 펴고 잘라내세요. PDF 자르기 도구로 인식을 방해하는 어두운 테두리를 잘라낼 수 있습니다.
텍스트 미리보기 확인
OCR은 통계적 방식이므로 100% 정확도는 보장되지 않습니다. 특히 특이한 글꼴이나 낮은 대비에서 그렇습니다. 검색 결과를 신뢰하기 전에 추출된 텍스트 보기로 몇 문단을 표본 확인하고, 결과가 엉망이라면 언어를 조정해 다시 실행하세요.
텍스트 기반 PDF에는 OCR을 건너뛰세요
도구가 문서에 이미 텍스트 레이어가 있다고 알려 준다면 OCR은 필요하지 않습니다. PDF to Word 같은 추출 도구가 바로 작동하며 몇 초 만에 끝납니다.
자주 묻는 질문
파일이 정말 어디에도 업로드되지 않나요?
맞습니다. 인식은 WebAssembly를 통해 브라우저에서 실행됩니다. 유일한 네트워크 통신은 OCR 엔진과 언어 팩을 한 번 다운로드하는 것이며, 이후 실행을 위해 캐시됩니다.
언어는 몇 개까지 선택할 수 있나요?
페이지에 표시된 실행당 제한까지 가능합니다. 예를 들어 한영 이중 언어 계약서에서 영어와 중국어를 함께 쓰는 식으로 언어를 자유롭게 섞어도 되지만, 문서에 없는 언어는 실행 속도만 느려지므로 빼세요.
OCR을 하면 스캔한 모양이 바뀌나요?
아니요. 페이지는 원래 모습을 유지하고, 인식된 텍스트가 스캔 아래에 위치한 보이지 않는 레이어로 추가됩니다. 같은 문서를 보지만 검색과 복사가 이제 작동합니다.