PDF에서 텍스트를 뽑아 편집 가능한 문서로 돌려주는 도구입니다. PDF.js로 파일이 이미 담고 있는 텍스트 객체, 즉 모든 문자와 그 페이지상 좌표를 읽은 뒤, 세로 좌표를 비교해 다시 줄 단위로 묶습니다. 결과는 Word 호환 .doc 파일 또는 일반 .txt로 저장됩니다.
기대치를 정확히 정해 두는 편이 좋습니다. "PDF를 Word로"라는 말은 어떤 변환기도 지킬 수 없는 약속을 하기 때문입니다. PDF는 각 글리프가 페이지 어디에 놓이는지를 기술할 뿐, 어떤 텍스트 덩어리가 제목이었는지 목록이었는지 표 셀이었는지 2단 레이아웃이었는지는 기록하지 않습니다. 그 구조를 복원하는 것은 추측이고, 이 도구는 추측하지 않습니다. 얻는 것은 읽는 순서대로 문단으로 정리된 텍스트입니다. 충실한 복제본이 아니라 다시 쓰기 위한 깨끗한 출발점입니다.
텍스트 추출과 문서 조립 모두 브라우저 안에서 이뤄집니다. 파일을 넘겨야 하는 변환 서비스와 달리 업로드가 없습니다.
.doc를 만듭니다. 일반 텍스트는 서식이 전혀 없는 .txt를 만듭니다.| 요소 | 결과 |
|---|---|
| 본문 텍스트 | 읽는 순서대로 정확히 추출 |
| 문단 구분 | 줄 위치로부터 복원 |
| 페이지 구분 | 유지 |
| 제목·스타일 | 사라짐. 전부 본문이 됨 |
| 표 | 텍스트 줄로 평탄화 |
| 이미지·차트 | 포함되지 않음 |
| 다단 | 파일 내부 순서대로 읽혀 섞일 수 있음 |
스캔 문서에는 텍스트 객체가 아니라 페이지 사진이 들어 있습니다. 이 도구가 추출할 것이 없으므로 텍스트를 찾지 못했다고 표시됩니다. 문자를 시각적으로 인식해 텍스트 파일을 만들어 주는 OCR 도구를 대신 쓰세요.
어느 쪽인지는 아무 PDF 뷰어에서 구분할 수 있습니다. 문장 하나를 마우스로 선택해 보세요. 커서가 생기고 단어가 하이라이트되면 이 변환기가 작동합니다. 페이지 전체에 사각형 선택만 잡히면 스캔본입니다.
PDF가 문서 구조가 아니라 글리프 위치를 저장하기 때문입니다. 어떤 것이 제목이었는지 표였는지 목록이었는지에 대한 기록이 없어서 어떤 변환기도 안정적으로 복원할 수 없습니다. 이 도구는 텍스트를 충실히 추출하고 서식은 사용자에게 맡깁니다.
거의 확실히 스캔본입니다. 텍스트 레이어 없이 페이지 이미지만 들어 있는 파일이죠. 문자를 시각적으로 인식하는 OCR 도구를 쓰세요.
아니요. PDF에서 표 셀은 위치가 지정된 텍스트일 뿐이라 일반 줄로 나옵니다. 복잡한 표는 대개 직접 다시 만들어야 합니다.
.doc는 문단과 페이지 구분을 유지하며 Word, 구글 문서, LibreOffice에서 열립니다. .txt는 구조가 전혀 없는 순수 텍스트로, 다른 소프트웨어에 넣을 때 유용합니다.
아니요. 텍스트 레이어만 추출됩니다. 페이지를 그림으로 얻으려면 PDF를 JPG로를 쓰세요.
아니요. PDF.js가 브라우저에서 텍스트를 읽고 출력 파일도 로컬에서 조립된 뒤 내려받습니다.