PDF를 Word로 변환

홈으로 돌아가기
PDF 파일을 추가하세요 — 또는 여기로 드래그
PDF

PDF를 Word로 변환하는 방식

PDF에서 텍스트를 뽑아 편집 가능한 문서로 돌려주는 도구입니다. PDF.js로 파일이 이미 담고 있는 텍스트 객체, 즉 모든 문자와 그 페이지상 좌표를 읽은 뒤, 세로 좌표를 비교해 다시 줄 단위로 묶습니다. 결과는 Word 호환 .doc 파일 또는 일반 .txt로 저장됩니다.

기대치를 정확히 정해 두는 편이 좋습니다. "PDF를 Word로"라는 말은 어떤 변환기도 지킬 수 없는 약속을 하기 때문입니다. PDF는 각 글리프가 페이지 어디에 놓이는지를 기술할 뿐, 어떤 텍스트 덩어리가 제목이었는지 목록이었는지 표 셀이었는지 2단 레이아웃이었는지는 기록하지 않습니다. 그 구조를 복원하는 것은 추측이고, 이 도구는 추측하지 않습니다. 얻는 것은 읽는 순서대로 문단으로 정리된 텍스트입니다. 충실한 복제본이 아니라 다시 쓰기 위한 깨끗한 출발점입니다.

텍스트 추출과 문서 조립 모두 브라우저 안에서 이뤄집니다. 파일을 넘겨야 하는 변환 서비스와 달리 업로드가 없습니다.

PDF를 편집 가능한 문서로 바꾸는 방법

  1. PDF를 불러옵니다. 영역에 끌어다 놓으세요. 실제 텍스트 레이어가 있어야 합니다. 스캔본이라면 아래 설명을 보세요.
  2. 출력 형식을 고릅니다. Word 문서는 Word, 구글 문서, LibreOffice가 모두 여는 .doc를 만듭니다. 일반 텍스트는 서식이 전혀 없는 .txt를 만듭니다.
  3. 변환합니다. 각 페이지의 텍스트를 차례로 읽어 줄과 문단으로 묶습니다.
  4. 내려받아 정리합니다. 열어 보면 제목, 목록, 표는 다시 손봐야 합니다. 단어와 그 순서는 정확합니다.

넘어오는 것과 넘어오지 않는 것

요소결과
본문 텍스트읽는 순서대로 정확히 추출
문단 구분줄 위치로부터 복원
페이지 구분유지
제목·스타일사라짐. 전부 본문이 됨
텍스트 줄로 평탄화
이미지·차트포함되지 않음
다단파일 내부 순서대로 읽혀 섞일 수 있음

PDF가 스캔본이라면

스캔 문서에는 텍스트 객체가 아니라 페이지 사진이 들어 있습니다. 이 도구가 추출할 것이 없으므로 텍스트를 찾지 못했다고 표시됩니다. 문자를 시각적으로 인식해 텍스트 파일을 만들어 주는 OCR 도구를 대신 쓰세요.

어느 쪽인지는 아무 PDF 뷰어에서 구분할 수 있습니다. 문장 하나를 마우스로 선택해 보세요. 커서가 생기고 단어가 하이라이트되면 이 변환기가 작동합니다. 페이지 전체에 사각형 선택만 잡히면 스캔본입니다.

자주 묻는 질문

변환된 문서가 왜 PDF와 전혀 다르게 보이나요?

PDF가 문서 구조가 아니라 글리프 위치를 저장하기 때문입니다. 어떤 것이 제목이었는지 표였는지 목록이었는지에 대한 기록이 없어서 어떤 변환기도 안정적으로 복원할 수 없습니다. 이 도구는 텍스트를 충실히 추출하고 서식은 사용자에게 맡깁니다.

PDF에서 아무것도 추출되지 않았어요. 왜죠?

거의 확실히 스캔본입니다. 텍스트 레이어 없이 페이지 이미지만 들어 있는 파일이죠. 문자를 시각적으로 인식하는 OCR 도구를 쓰세요.

표가 유지되나요?

아니요. PDF에서 표 셀은 위치가 지정된 텍스트일 뿐이라 일반 줄로 나옵니다. 복잡한 표는 대개 직접 다시 만들어야 합니다.

.doc와 .txt 출력의 차이는 무엇인가요?

.doc는 문단과 페이지 구분을 유지하며 Word, 구글 문서, LibreOffice에서 열립니다. .txt는 구조가 전혀 없는 순수 텍스트로, 다른 소프트웨어에 넣을 때 유용합니다.

PDF의 이미지도 포함되나요?

아니요. 텍스트 레이어만 추출됩니다. 페이지를 그림으로 얻으려면 PDF를 JPG로를 쓰세요.

문서가 업로드되나요?

아니요. PDF.js가 브라우저에서 텍스트를 읽고 출력 파일도 로컬에서 조립된 뒤 내려받습니다.

관련 도구