将PDF转换为Word

返回首页
添加PDF文件 — 或拖放到此处
PDF

关于这个 PDF 转 Word 工具

这个工具把 PDF 里的文字取出来,交还给你一份可编辑的文档。它用 PDF.js 读取文件本身已有的文字对象——每一个字符及其在页面上的坐标——再通过比较纵坐标把它们重新归并成行。结果可以写成 Word 兼容的 .doc 文件,或者纯 .txt

有必要把预期说准确,因为「PDF 转 Word」这句话承诺了任何转换器都做不到的事。PDF 描述的是每个字形落在页面的什么位置,它并不记录某段文字曾经是标题、是项目符号、是表格单元格还是双栏排版。重建这些结构是猜测,而本工具不做猜测。你得到的是按阅读顺序整理成段落的文字——不是忠实复制品,而是用来重写的干净起点。

文字提取和文档组装都在浏览器内完成。与那些需要你交出文件的转换服务不同,这里没有上传。

如何把 PDF 转成可编辑文档

  1. 载入 PDF。 拖到投放区。文件需要有真实的文字层;如果是扫描件,请看下文。
  2. 选择输出。 Word 文档生成 Word、Google 文档和 LibreOffice 都能打开的 .doc纯文本生成完全没有格式的 .txt
  3. 转换。 逐页读取文字并归并为行和段落。
  4. 下载并整理。 打开后你会需要重做标题、列表和表格。文字内容及其顺序则是准确的。

哪些能带过来,哪些不能

元素结果
正文文字按阅读顺序精确提取
段落分隔依据行位置还原
分页保留
标题与样式丢失,一律变成正文
表格被压平成文字行
图片与图表不包含
分栏按文件内部顺序读取,可能交错

如果你的 PDF 是扫描件

扫描文档里装的是页面照片,不是文字对象。本工具没有可提取的内容,会提示未找到文字。请改用 OCR 工具,它通过视觉识别字符并生成可用的文本文件。

用任何 PDF 阅读器都能分辨:试着用鼠标选中一句话。如果出现文本光标、词句被高亮,本转换器就能工作;如果整页只能拉出一个矩形选区,那就是扫描件。

常见问题

为什么转换后的文档和 PDF 完全不像?

因为 PDF 保存的是字形位置而不是文档结构。文件里没有记录什么是标题、什么是表格、什么是列表,所以没有哪个转换器能可靠还原。本工具忠实提取文字,把格式留给你。

我的 PDF 什么都没提取出来,为什么?

几乎可以肯定它是扫描件——只有页面图片、没有文字层的文件。请改用通过视觉识别字符的 OCR 工具。

表格会保留吗?

不会。PDF 里的表格单元格只是被定位的文字,因此会输出为普通行。复杂表格通常需要手工重建。

.doc 和 .txt 输出有什么区别?

.doc 保留段落和分页,可在 Word、Google 文档和 LibreOffice 中打开;.txt 是完全没有结构的纯文本,适合导入其他软件。

PDF 里的图片会包含进来吗?

不会。只提取文字层。若需要把页面作为图片,请使用 PDF 转 JPG。

文档会被上传吗?

不会。PDF.js 在浏览器内读取文字,输出文件也在本地组装后下载。

相关工具