优化 PDF 文件
OCR PDF 可以做什么?
OCR PDF 会在浏览器中为扫描 PDF 添加可搜索、可选择的文字层,并保留原页面图像和页序。它不会把版式重建成可编辑的 Word。你可以自动检测语言或手动选择。准确度随扫描质量变化,请核对姓名、数字、手写和生僻字。
如何使用 OCR PDF
- 1选择一份 PDF
打开 OCR PDF,选择一个扫描或图像型 PDF。受保护文件需先解锁。每次任务只接受一份 PDF。
- 2选择 OCR 语言
可使用自动检测,或选择与页面匹配的语言。自动模式会按需加载对应脚本数据。选错语言会降低准确度。
- 3保留可搜索层
除非你只需要内存中的识别文本,否则请保持可搜索文字选项开启。通常结果仍显示原页面图像,并带有隐藏的可搜索文字。
- 4在本地识别
每一页都会在浏览器中用 Tesseract 渲染并识别。语言模型来自本站 tessdata;文档本身不会上传到应用服务器。
- 5核对结果
搜索姓名、金额和生僻字。OCR 不会重建可编辑版式。只有在接受识别结果后,才应再转为 Word 或 Excel。
支持的文件与限制
- 输出格式: PDF
- 输入: PDF
- 输出选项: 自动或所选 OCR 语言; 可搜索文字层
- 每次任务一份 PDF; 识别效果取决于扫描质量和语言数据
- 文件始终留在本机,关闭页面后即清除。
识别效果取决于扫描质量和语言数据。姓名、数字、手写和生僻字可能出错。OCR 添加的是文字层,不会重建可编辑版式。
输出会保留什么
- 原页面图像
- 页序
原页面图像仍然可见,页序不变。开启可搜索选项时,识别出的字符会作为可搜索、可选择的文字层保存。
可能变化或丢失的内容
- 姓名、数字、手写和生僻字的识别准确度
相似字形、褪色扫描、印章和手写可能被误识。它不会恢复字体、分栏或矢量图形。自动语言检测在混排页面上可能选错脚本。
什么情况下不要用这个工具
不要把 OCR PDF 当作校对替代、版式保真的 Word 转换,或在未经授权时用来打开加密文件。已经带有正确文字层的电子版 PDF 通常没有收益。
处理失败时怎么办
若识别结果为空,页面可能太暗、太小或不在支持的脚本中——请提高扫描质量或选择正确语言。若语言包加载失败,请检查 tessdata 网络请求后重试。加密文件需先解锁。页数很多时会运行很久,也可能耗尽内存。
隐私边界
页面图像在当前浏览器中识别。PDF 内容不会发送到 PDF Smart Kit 应用服务器。OCR 语言模型是站点静态资源。关闭页面即可从内存中清除当前任务。
测试证据
最后测试: · 测试浏览器: 通过 Playwright Chromium 测试的桌面 Chrome · 对应版本: 1.0.0
样本: 包含印刷体拉丁文字的图像型 PDF 页面 · 1 页
验证项目
- 下载结果是有效的 PDF。
- 印刷体样本经 OCR 处理后具有可搜索文字层。
- 识别使用所选语言包。
已知失败与边界
- 手写内容、低对比度扫描件和少见字体仍需人工复核。
- OCR 不会恢复原始文档结构或字体。