从 PDF 转换至其他格式
PDF 转 Word 可以做什么?
PDF 转 Word 会在当前浏览器中把一份 PDF 转为 DOCX。可提取的文字会变成可编辑、带位置的文本;图片和其他非文字图稿会作为每页的背景图保留。未经 OCR 的扫描页没有可编辑文字。字体度量和复杂版式可能偏移,使用前请检查 Word 文件。
如何使用 PDF 转 Word
- 1选择一份 PDF
打开 PDF 转 Word,从本机选择一个 PDF。受密码保护的文件需先解锁。界面每次只接受一份 PDF。
- 2确认预览
核对要转换的页面。没有额外版式选项;转换会把每一页 PDF 映射为一个固定版式的 Word 节。
- 3在本地转换
开始转换后,可提取文字会放入定位文本框,非文字图形作为页面图稿保留在文字下方。
- 4下载 DOCX
用 Word 或其他编辑器打开结果,检查姓名、间距、图片和分页。密集或不常见版式可能需要手动修正。
- 5没有文字时先做 OCR
如果页面是扫描件,或文字被画成图像,请先使用 OCR PDF,再重新转换,以便提取可搜索文字层。
支持的文件与限制
- 输出格式: DOCX
- 输入: PDF
- 输出选项: 自动固定版式转换
- 界面每次任务一份 PDF; 可能需要手动修正
- 文件始终留在本机,关闭页面后即清除。
输出是固定版式 DOCX,不是会随窗口重排的原生 Word 文稿。精确字体度量不会保留,扫描页需先 OCR,且每次任务只接受一份 PDF。
输出会保留什么
- 可提取文字
- 近似的文字位置和样式
- 非文字页面图稿
PDF.js 能提取的文字会保留为可编辑 Word 文本,并尽量保持位置、大小和样式。非文字页面图稿会作为背景图保留,因此图表和照片仍然可见。
可能变化或丢失的内容
- 精确字体度量
- 复杂版式关系
- 可编辑矢量图形
- 未经 OCR 的扫描文字
矢量图形不会重建为 Word 形状。分栏、表格和绕排可能偏移。只存在于像素、轮廓或不支持编码中的文字,在 OCR 或其他来源补齐之前会被省略。
什么情况下不要用这个工具
如果需要可重排的文稿、像素级印刷效果、可编辑的原生图形,或幻灯片结构,请不要使用 PDF 转 Word。未经 OCR 的扫描件不适用;它也不会从打印表格中恢复电子表格公式。
处理失败时怎么办
若 PDF 已加密,请先解锁。若浏览器无法解析文件,请先修复或导出可读副本。若 DOCX 只有图片没有文字,页面多半是扫描件或轮廓字;请先运行 OCR PDF 再转换。过大的文件可能在内存不足的设备上失败,可关闭其他标签页或减少页数后重试。
隐私边界
所选 PDF 只在当前浏览器中读取,用于本次任务。PDF Smart Kit 不会把文档内容发送到应用服务器。预览会留在内存中,直到你关闭或刷新页面。下载的 DOCX 只保存在浏览器的下载位置。
测试证据
最后测试: · 测试浏览器: 通过 Playwright Chromium 测试的桌面 Chrome · 对应版本: 1.0.0
样本: 包含可提取英文标题的数字 PDF · 2 页
验证项目
- 下载结果是有效的 DOCX,可在编辑器中打开。
- 源文件中可提取的文字会成为可编辑的 Word 文字,而非仅以图片呈现。
- 非文字页面图稿以图片形式保留。
- 输出页数与源 PDF 一致。
已知失败与边界
- 扫描页或仅含轮廓的页面,在先使用 OCR PDF 之前没有可编辑文字。
- DOCX 是对固定版式的近似还原;换行、字体和原生图形可能与 PDF 不同。