本地转换任务

OCR PDF

轻松将扫描PDF文件转换为可搜索內容、可选择內容的文件。

文件始终留在本机,关闭页面后即清除。
将文件拖放到这里

优化 PDF 文件

OCR PDF 可以做什么?

OCR PDF 会在浏览器中为扫描 PDF 添加可搜索、可选择的文字层,并保留原页面图像和页序。它不会把版式重建成可编辑的 Word。你可以自动检测语言或手动选择。准确度随扫描质量变化,请核对姓名、数字、手写和生僻字。

如何使用 OCR PDF

  1. 1
    选择一份 PDF

    打开 OCR PDF,选择一个扫描或图像型 PDF。受保护文件需先解锁。每次任务只接受一份 PDF。

  2. 2
    选择 OCR 语言

    可使用自动检测,或选择与页面匹配的语言。自动模式会按需加载对应脚本数据。选错语言会降低准确度。

  3. 3
    保留可搜索层

    除非你只需要内存中的识别文本,否则请保持可搜索文字选项开启。通常结果仍显示原页面图像,并带有隐藏的可搜索文字。

  4. 4
    在本地识别

    每一页都会在浏览器中用 Tesseract 渲染并识别。语言模型来自本站 tessdata;文档本身不会上传到应用服务器。

  5. 5
    核对结果

    搜索姓名、金额和生僻字。OCR 不会重建可编辑版式。只有在接受识别结果后,才应再转为 Word 或 Excel。

支持的文件与限制

  • 输出格式: PDF
  • 输入: PDF
  • 输出选项: 自动或所选 OCR 语言; 可搜索文字层
  • 每次任务一份 PDF; 识别效果取决于扫描质量和语言数据
  • 文件始终留在本机,关闭页面后即清除。

识别效果取决于扫描质量和语言数据。姓名、数字、手写和生僻字可能出错。OCR 添加的是文字层,不会重建可编辑版式。

输出会保留什么

  • 原页面图像
  • 页序

原页面图像仍然可见,页序不变。开启可搜索选项时,识别出的字符会作为可搜索、可选择的文字层保存。

可能变化或丢失的内容

  • 姓名、数字、手写和生僻字的识别准确度

相似字形、褪色扫描、印章和手写可能被误识。它不会恢复字体、分栏或矢量图形。自动语言检测在混排页面上可能选错脚本。

什么情况下不要用这个工具

不要把 OCR PDF 当作校对替代、版式保真的 Word 转换,或在未经授权时用来打开加密文件。已经带有正确文字层的电子版 PDF 通常没有收益。

处理失败时怎么办

若识别结果为空,页面可能太暗、太小或不在支持的脚本中——请提高扫描质量或选择正确语言。若语言包加载失败,请检查 tessdata 网络请求后重试。加密文件需先解锁。页数很多时会运行很久,也可能耗尽内存。

隐私边界

页面图像在当前浏览器中识别。PDF 内容不会发送到 PDF Smart Kit 应用服务器。OCR 语言模型是站点静态资源。关闭页面即可从内存中清除当前任务。

测试证据

最后测试: · 测试浏览器: 通过 Playwright Chromium 测试的桌面 Chrome · 对应版本: 1.0.0

样本: 包含印刷体拉丁文字的图像型 PDF 页面 · 1 页

验证项目

  • 下载结果是有效的 PDF。
  • 印刷体样本经 OCR 处理后具有可搜索文字层。
  • 识别使用所选语言包。

已知失败与边界

  • 手写内容、低对比度扫描件和少见字体仍需人工复核。
  • OCR 不会恢复原始文档结构或字体。

PDF Smart Kit 如何测试工具

常见问题

发布者: Windx Ltd最后审核: