PDF OCR로 스캔 문서를 검색 가능하게 만드는 무료 방법
오래된 계약서나 영수증 더미를 스캔해서 PDF로 저장해 두었다가, 몇 주 뒤 특정 조항이나 거래처 이름 하나를 찾으려고 Ctrl+F를 눌러도 아무것도 나오지 않는 경험, 있으시죠? 스캔본은 결국 글자를 찍은 사진일 뿐이기 때문입니다. 컴퓨터는 단어가 아니라 픽셀을 볼 뿐이죠. OCR은 바로 이 문제를 해결해, 밋밋한 이미지를 실제로 검색하고 복사하고 다시 활용할 수 있는 문서로 바꿔줍니다.
OCR이 PDF에 실제로 하는 일
OCR은 광학 문자 인식(optical character recognition)의 줄임말입니다. 페이지 이미지 속 글자 모양을 분석해 어떤 글자와 단어인지 알아낸 뒤, 그 텍스트를 보이지 않는 레이어로 파일 안에 기록합니다.
여기서 똑똑한 점은, 원본 스캔본은 조금도 바뀌지 않는다는 것입니다. 인식된 텍스트는 페이지 이미지 뒤에 보이지 않는 레이어로 자리 잡으며, 눈에 보이는 글자와 정확히 겹쳐 놓입니다. 그래서 문서의 모습은 처음 스캔한 그대로지만, 이제는 모든 단어를 선택하고 검색하고 복사할 수 있습니다. 화질에는 아무런 변화가 없습니다.
이 작은 변화 하나가 많은 것을 가능하게 합니다. 검색 가능한 PDF에서는 어떤 단어든 몇 초 만에 찾을 수 있고, 문단을 다시 타이핑하는 대신 그대로 복사할 수 있으며, 실제 텍스트가 필요한 다른 도구에 파일을 넘길 수도 있습니다. 나중에 편집 가능한 문서로 변환하는 작업처럼 말이죠.
스캔한 PDF를 검색 가능하게 만드는 방법
OCR PDF 도구를 사용한 전체 과정을 소개합니다. 1분 정도면 끝나며, 가입이나 워터마크, 설치할 소프트웨어가 전혀 없습니다.
- 도구를 엽니다. PDF168에서 OCR PDF로 이동합니다.
- 스캔한 PDF를 추가합니다. 파일을 페이지 위로 끌어다 놓거나, 클릭해서 컴퓨터에서 직접 선택합니다. 이 도구는 스캔본과 이미지로만 된 PDF를 지원합니다.
- 문서 언어를 설정합니다. 문서에 맞는 Tesseract 언어 코드를 입력하세요. 영어는
eng, 번체 중국어 같은 경우는chi_tra같은 코드를 씁니다. 내용에 맞는 언어를 지정하는 것이 정확도를 좌우하는 가장 큰 요인입니다. - OCR 모드를 선택합니다. 파일 일부가 이미 디지털 텍스트라면 이미 텍스트가 있는 페이지는 건너뛰기(기본값이자 가장 안전한 선택)를 고릅니다. “텍스트”처럼 보이는 페이지까지 실제로는 스캔본일 때는 모든 페이지에 강제로 OCR 적용을 사용하세요.
- 실행합니다. 처리를 시작합니다. 파일은 암호화된 연결을 통해 안전한 서버로 업로드되어, 한 번의 처리로 페이지마다 텍스트가 인식됩니다.
- 검색 가능한 PDF를 내려받습니다. 돌려받은 파일을 저장하세요. 겉모습은 이전과 똑같지만, 이제 모든 단어를 검색하고 선택할 수 있습니다.
이것이 전부입니다. 여러 페이지로 된 문서도 한 번에 처리되어 하나의 파일로 돌아옵니다.
알맞은 언어와 모드 고르기
몇 가지 작은 선택이 거의 완벽한 인식과 알아볼 수 없는 엉망진창 사이를 가릅니다.
- 언어 코드를 맞추세요. OCR은 선택한 언어를 바탕으로 어떤 글자일 가능성이 높은지 판단합니다. 언어를 잘못 고르면 강세 부호가 붙은 글자나 키릴 문자, 동아시아 문자가 엉뚱하게 인식됩니다. 이 도구는 수십 개 언어를 지원하니, 가장 가까운 것을 골라 쓰세요.
- 여러 언어가 섞인 문서. 한 페이지에 두 가지 언어가 있다면, 코드를 조합(예: 영어와 다른 문자)해서 엔진이 둘 다 인식하도록 할 수 있습니다.
- 텍스트 건너뛰기 vs. 강제 적용. 텍스트 건너뛰기는 실제 텍스트는 그대로 두고 이미지 페이지만 OCR합니다. 텍스트와 이미지가 섞인 파일에서 빠르고 깔끔하죠. 강제 OCR은 모든 것을 다시 인식하므로, “디지털”인 척하지만 실제로는 스캔본인 PDF에 딱 맞는 선택입니다.
- 들어가는 품질이 곧 나오는 품질입니다. OCR은 보이는 것만 읽을 수 있습니다. 밝은 조명에서 또렷하게 찍은 300 DPI 스캔본은 흐릿한 휴대폰 사진보다 훨씬 잘 인식됩니다. 결과가 좋지 않다면, 더 높은 해상도로 다시 스캔한 뒤 시도해 보세요.
검색 가능한 PDF로 할 수 있는 일
파일에 실제 텍스트 레이어가 생기면 할 수 있는 일이 많아집니다. 어떤 PDF 뷰어에서든 바로 검색하고 복사할 수 있습니다. 이미지 위에 상자를 그리는 대신 실제 단어에 형광펜을 칠하고 주석을 달 수 있습니다. 그리고 선택 가능한 텍스트가 필요한 다른 도구에 파일을 넘길 수도 있습니다.
레이아웃은 필요 없고 복사할 수 있는 순수 텍스트만 원한다면, 검색 가능해진 파일을 PDF to Text로 돌려 깔끔한 일반 텍스트로 내보내세요. Word에서 내용을 편집하고 싶다면, 먼저 OCR을 한 다음 PDF to Word로 변환하는 것이 올바른 순서입니다. OCR 없이 스캔본을 바로 Word로 변환하면, 옮겨 올 텍스트가 없기 때문에 빈 문서나 엉망인 문서가 만들어집니다.
개인정보 보호에 관하여
OCR은 보기보다 무거운 작업입니다. 모든 페이지의 모든 글자를 인식하려면 실제 연산 성능이 필요하기 때문에, 이 도구는 브라우저가 아니라 저희 서버에서 실행됩니다. 여러분의 PDF는 암호화된(HTTPS) 연결을 통해 전송되어 안전한 서버에서 처리된 뒤 다시 돌아옵니다. 처리 후에는 저장되거나 공유되지 않고, 광고나 학습에도 사용되지 않으며, 계정이나 이메일도 필요 없습니다. 매우 민감한 자료라면, 필요한 검색 가능 버전을 받은 뒤 로컬 작업본을 삭제해 두는 것이 여전히 좋은 습관입니다.
예전에는 스캔본을 디지털화하려면 값비싼 데스크톱 소프트웨어를 쓰거나 페이지를 손으로 다시 타이핑해야 했습니다. 이제는 OCR PDF에 파일을 끌어다 놓고, 언어를 고른 뒤, 1분도 안 되어 완전히 검색 가능한 문서를 내려받을 수 있습니다. 무료로, 그것도 안전한 연결을 통해서요. 검색되지 않는 스캔본 더미가 또 생길 때를 위해 즐겨찾기에 추가해 두세요.
자주 묻는 질문
OCR란 무엇이고, 스캔한 PDF에 왜 필요한가요?
OCR(광학 문자 인식)은 페이지 이미지 속 글자를 읽어내어 실제로 선택할 수 있는 문자로 바꿔줍니다. 스캔본은 글자를 찍은 사진일 뿐이라, OCR이 없으면 그 안의 단어를 하나도 검색하거나 복사하거나 형광펜으로 표시할 수 없습니다.
OCR을 하면 스캔한 페이지의 모습이 바뀌나요?
아니요. 이 도구는 원본 페이지 이미지 뒤에 보이지 않는 텍스트 레이어를 추가하므로, 스캔본의 겉모습은 그대로이면서 단어만 검색하고 선택할 수 있게 됩니다. 선명하고 고해상도인 스캔본일수록 인식 정확도가 가장 높습니다.
OCR을 실행하면 제 파일이 업로드되나요?
네. OCR은 실제 처리 성능이 필요하기 때문에, PDF가 암호화된(HTTPS) 연결을 통해 안전한 서버로 전송되어 인식 처리된 뒤 다시 돌려받게 됩니다. 처리가 끝난 파일은 저장되거나 보관되지 않으며, 계정이나 이메일도 필요 없습니다.