텍스트 인식 (OCR)

PDF 또는 이미지 파일을 추가하세요 — 또는 여기로 드래그
PDF JPG PNG WEBP

OCR 텍스트 인식에 관하여

광학 문자 인식은 글자가 찍힌 그림에서 글자를 읽어냅니다. 스캔한 계약서, 촬영한 영수증, 오류 메시지 스크린샷은 문서처럼 보이지만 컴퓨터가 선택하거나 검색하거나 복사할 수 있는 텍스트를 담고 있지 않습니다. OCR은 글자의 형태를 살펴 문자를 복원합니다.

이 도구는 오랜 역사를 가진 오픈소스 OCR 엔진 Tesseract를 WebAssembly로 컴파일해 서버가 아닌 브라우저 안에서 실행합니다. PDF 페이지는 인식 전에 원본의 2배 크기로 렌더링되는데, 해상도가 정확도를 좌우하는 가장 큰 요인이기 때문입니다. 결과는 페이지 구분 표시가 들어간 일반 텍스트 파일입니다.

인식이 사용자 기기에서 실행됩니다. OCR 서비스는 대개 업로드를 요구하므로 이는 이례적인 방식이며, 급여명세서·진단서·신분 증명서를 전송하지 않고 읽을 수 있다는 뜻입니다.

OCR로 텍스트를 추출하는 방법

  1. PDF나 이미지를 추가합니다. 스캔본, 사진, 스크린샷 모두 됩니다. PDF와 함께 JPG, PNG, WebP, HEIC를 받습니다.
  2. 언어를 고릅니다. 자동은 페이지 언어와 영어를 함께 씁니다. 혼용 문서에 잘 맞습니다. 순수 영어 문서라면 영어로 고정하세요.
  3. 인식을 시작합니다. 언어 모델은 처음 쓸 때 내려받은 뒤 캐시됩니다. 페이지당 몇 초가 걸리며 진행 카운터가 표시됩니다.
  4. 텍스트를 내려받습니다. 결과는 UTF-8 .txt 파일이며 페이지가 번호 구분자로 나뉘어 있습니다.

정확도를 좌우하는 요인

요인결과에 미치는 영향
원본 해상도가장 결정적. 300 DPI 스캔은 안정적이고 100 DPI는 추측에 가까움
기울기2도만 넘어가도 정확도가 빠르게 떨어짐
대비흰 바탕 검은 글자가 이상적. 흐린 복사본과 유색 배경은 불리
서체일반 명조·고딕은 안정적. 손글씨는 지원되지 않음
레이아웃단일 단은 깔끔하게 흐름. 다단과 표는 구조가 사라짐

언어에 관하여

자동 모드는 현재 페이지의 언어와 영어를 함께 씁니다. 한국어 문서는 한국어 + 영어로, 일본어 문서는 일본어 + 영어로 인식하는 식입니다. 한 언어로 쓰인 문서에 영어 제품명, 주소, 기술 용어가 섞여 있는 현실적인 상황에 맞춘 조합입니다.

각 언어 모델은 수 메가바이트짜리 별도 다운로드로, 처음 쓸 때 받아 브라우저가 캐시합니다. 그래서 새 언어의 첫 실행은 두 번째보다 눈에 띄게 오래 걸립니다.

자주 묻는 질문

OCR이 서버에서 실행되나요?

아니요. 그게 핵심입니다. Tesseract가 WebAssembly로 컴파일되어 브라우저 탭 안에서 실행됩니다. 스캔본이 업로드되지 않으므로 온라인 서비스에 넘기고 싶지 않은 문서에도 안전합니다.

정확도는 어느 정도인가요?

깨끗하고 반듯한 300 DPI 인쇄 문서 스캔이라면 대개 95%를 크게 웃돕니다. 흐린 복사본, 기울어진 페이지, 저해상도 사진, 특이한 서체는 모두 정확도를 눈에 띄게 떨어뜨립니다.

손글씨도 읽나요?

아니요. Tesseract는 인쇄 활자로 학습되었습니다. 손으로 쓴 메모, 서명, 필기체는 인식되지 않습니다.

결과물 형식은 무엇인가요?

UTF-8 일반 텍스트 파일입니다. 페이지는 번호가 붙은 구분자로 나뉩니다. 레이아웃, 단, 표, 이미지는 보존되지 않습니다.

첫 실행이 왜 이렇게 느린가요?

수 메가바이트짜리 언어 모델을 내려받아야 하기 때문입니다. 이후 캐시되므로 같은 언어의 다음 문서는 바로 시작됩니다.

검색 가능한 PDF가 만들어지나요?

아니요. 결과는 PDF에 텍스트 레이어를 다시 넣는 것이 아니라 별도의 텍스트 파일입니다. 검색, 인용, 다른 시스템에 넣는 용도로 쓰세요.

관련 도구