PDF 텍스트 검색이 안 될 때 — OCR로 글자를 찾는 방법

돋보기로 PDF 문서의 글자를 찾는 일러스트

이력서나 계약서처럼 스캔해 만든 PDF에서 Ctrl+F 검색을 눌렀는데 "일치하는 항목이 없습니다"라는 메시지만 뜬 적이 있나요? 이 글은 PDF 텍스트 검색이 안 되는 이유 를 설명하고, 스캔 문서를 검색 가능한 텍스트로 바꾸는 OCR의 기본 원리와 한계를 정리합니다.

1. PDF인데 왜 텍스트 검색이 안 될까?

PDF에는 크게 두 종류가 있습니다. 워드·한글 같은 문서 프로그램에서 만든 "텍스트 PDF"와 스캐너나 카메라로 이미지화한 "이미지 PDF"입니다. 검색이 안 되는 PDF는 대부분 후자입니다. 이미지 PDF 안에는 글자가 아니라 사진처럼 픽셀로 찍힌 그림만 존재하기 때문입니다.

  • 텍스트 PDF - 글자가 실제 텍스트 데이터로 저장되어 검색·복사·수정이 가능
  • 이미지 PDF (스캔 PDF) - 종이를 사진처럼 찍어 저장. 검색·복사 불가

2. OCR은 무엇인가?

OCR(Optical Character Recognition, 광학 문자 인식)은 이미지 속 글자를 인식해 컴퓨터가 읽을 수 있는 텍스트로 바꾸는 기술입니다. OCR이 적용된 PDF는 아래와 같은 일이 가능해집니다.

  • Ctrl+F 텍스트 검색이 가능해집니다.
  • 문장을 복사해서 다른 문서에 붙여 넣을 수 있습니다.
  • 화면 낭독기 같은 보조 기술이 내용을 읽을 수 있습니다.

스캔 문서를 다루다 보면 OCR뿐 아니라 페이지를 이미지로 뽑아야 할 때도 있는데, 이 글에서 소개하는 방법은 대부분 PDF → 이미지 추출 도구 와 함께 쓸 수 있습니다.

3. 텍스트 PDF와 이미지 PDF를 구분하는 방법

받은 파일이 어떤 종류인지 확인하는 가장 빠른 방법은 파일을 열어 Ctrl+F를 눌러보는 것입니다. 검색이 되면 텍스트 PDF입니다. 더 확실하게 확인하려면 문서 뷰어에서 문자 선택(마우스 드래그)을 시도해 보세요. 글자가 드래그되면 텍스트 PDF, 드래그가 안 되고 사각형 영역만 잡히면 이미지 PDF입니다. PDFSkills PDF 뷰어 로 바로 확인해 볼 수 있습니다.

4. OCR의 한계와 주의할 점

OCR이 완벽한 것은 아닙니다. 아래 경우에는 오인식이 잦아 결과물을 꼭 확인해야 합니다.

  • 한글 - 영문보다 인식률이 낮고, 초·중·종성이 많은 글자가 자주 오인식됩니다.
  • 손글씨 - 인쇄체보다 오류율이 훨씬 높습니다.
  • 저품질 스캔 - 기울어진 스캔, 낮은 해상도, 얼룩이 있는 문서는 인식률이 급격히 떨어집니다.
OCR 결과는 법적 효력이 있는 계약서처럼 정확성이 중요한 문서에는 원본과 대조해서 사용 하는 것을 권장합니다.

5. OCR 없이도 활용할 수 있는 방법

스캔 문서에서 그림·도표 위주로 필요한 부분이 있다면 OCR까지 갈 필요가 없습니다. PDF → 이미지 추출 로 필요한 페이지만 고해상도 이미지로 뽑아 프레젠테이션이나 문서에 바로 활용할 수 있습니다. 이미지 포맷을 어떻게 골라야 하는지 궁금하다면 JPG vs PNG vs WebP 글 을 참고해 보세요.

마무리

검색이 안 되는 PDF는 대부분 스캔 이미지이므로, OCR로 텍스트화하면 검색·복사·편집이 가능해집니다. 다만 인식률의 한계를 이해하고 결과물을 확인하는 습관이 중요합니다. 아래 버튼으로 PDFSkills의 PDF → 이미지 도구를 바로 사용해 보세요. 모든 처리가 브라우저에서 이뤄지며 파일이 서버로 전송되지 않아 안전합니다.

PDF → 이미지 도구 바로가기

Sponsored