这个工具把 PDF 里的文字取出来,交还给你一份可编辑的文档。它用 PDF.js 读取文件本身已有的文字对象——每一个字符及其在页面上的坐标——再通过比较纵坐标把它们重新归并成行。结果可以写成 Word 兼容的 .doc 文件,或者纯 .txt。
有必要把预期说准确,因为「PDF 转 Word」这句话承诺了任何转换器都做不到的事。PDF 描述的是每个字形落在页面的什么位置,它并不记录某段文字曾经是标题、是项目符号、是表格单元格还是双栏排版。重建这些结构是猜测,而本工具不做猜测。你得到的是按阅读顺序整理成段落的文字——不是忠实复制品,而是用来重写的干净起点。
文字提取和文档组装都在浏览器内完成。与那些需要你交出文件的转换服务不同,这里没有上传。
.doc;纯文本生成完全没有格式的 .txt。| 元素 | 结果 |
|---|---|
| 正文文字 | 按阅读顺序精确提取 |
| 段落分隔 | 依据行位置还原 |
| 分页 | 保留 |
| 标题与样式 | 丢失,一律变成正文 |
| 表格 | 被压平成文字行 |
| 图片与图表 | 不包含 |
| 分栏 | 按文件内部顺序读取,可能交错 |
扫描文档里装的是页面照片,不是文字对象。本工具没有可提取的内容,会提示未找到文字。请改用 OCR 工具,它通过视觉识别字符并生成可用的文本文件。
用任何 PDF 阅读器都能分辨:试着用鼠标选中一句话。如果出现文本光标、词句被高亮,本转换器就能工作;如果整页只能拉出一个矩形选区,那就是扫描件。
因为 PDF 保存的是字形位置而不是文档结构。文件里没有记录什么是标题、什么是表格、什么是列表,所以没有哪个转换器能可靠还原。本工具忠实提取文字,把格式留给你。
几乎可以肯定它是扫描件——只有页面图片、没有文字层的文件。请改用通过视觉识别字符的 OCR 工具。
不会。PDF 里的表格单元格只是被定位的文字,因此会输出为普通行。复杂表格通常需要手工重建。
.doc 保留段落和分页,可在 Word、Google 文档和 LibreOffice 中打开;.txt 是完全没有结构的纯文本,适合导入其他软件。
不会。只提取文字层。若需要把页面作为图片,请使用 PDF 转 JPG。
不会。PDF.js 在浏览器内读取文字,输出文件也在本地组装后下载。