免费给 PDF 做 OCR,让扫描件变成可搜索文档
你扫描了一份旧合同或一叠收据,存成 PDF,几周后想去找其中某一条条款或某个供应商的名字——结果 Ctrl+F 什么都搜不到。这是因为扫描件只是一张文字的照片:你的电脑看到的是像素,而不是文字。OCR 能解决这个问题,把一张平面图像变成真正可以搜索、复制和重复利用的文档。
OCR 究竟对 PDF 做了什么
OCR 是光学字符识别(optical character recognition)的缩写。它会观察页面图像里的字形,判断它们代表哪些字母和文字,再把这些文字作为一个隐藏图层写进文件里。
巧妙之处在于,原始扫描件保持原封不动。识别出来的文字位于页面图像背后的一个隐形图层中,与你看到的内容完美对齐。所以文档看起来和你最初的扫描件一模一样,但现在每个字都可以选中、可以搜索、可以复制。视觉质量没有任何变化。
仅仅这一项改变就能解锁很多用途。可搜索的 PDF 让你能在几秒内找到任意词语,让你能复制一整段而不必重新打字,还能把文件交给其他需要真实文字的工具——比如之后把它转换成可编辑文档。
如何让扫描版 PDF 变得可搜索
下面是使用 OCR PDF 工具的完整流程。大约只需一分钟,无需注册、没有水印,也不用安装任何软件。
- 打开工具。 进入 PDF168 上的 OCR PDF。
- 添加你的扫描版 PDF。 把文件拖到页面上,或者点击浏览从电脑里选择。工具支持扫描件和纯图像的 PDF。
- 设置文档语言。 输入你文档对应的 Tesseract 语言代码——英文用
eng,繁体中文等用chi_tra这样的代码。让语言与内容相匹配,是影响识别准确度最关键的因素。 - 选择 OCR 模式。 如果你文件中有部分内容本身就是数字文本,请选择跳过已有文字的页面(默认且最稳妥的选项)。当连”文字”页面实际上也是扫描件时,就用对每一页强制 OCR。
- 运行。 启动处理。你的文件会通过加密连接上传到我们的安全服务器,在那里一次性逐页完成文字识别。
- 下载你的可搜索 PDF。 保存返回的文件。它看起来和之前一样,但现在你可以搜索和选中每一个字。
整个过程就是这样。多页文档会一次性处理完毕,并合并成单个文件返回。
选对语言和模式
几个小小的选择,决定了识别结果是近乎完美还是一团乱码。
- 匹配语言代码。 OCR 会根据你选择的语言来判断哪些字符更可能出现。选错了,带重音的字母、西里尔字母或亚洲文字就会识别错误。工具支持几十种语言,所以请选最接近的那个。
- 多语言文档。 如果一个页面有两种语言,你可以组合多个代码(例如英文加上另一种文字),让识别引擎同时识别两者。
- 跳过文字 vs. 强制识别。 跳过文字会保留原有的真实文字,只对图像页面做 OCR——对混合文件来说既快又干净。强制 OCR 会重新识别所有内容,当一个”数字版”PDF 其实是伪装的扫描件时,这才是正确的选择。
- 输入质量决定输出质量。 OCR 只能识别它能看清的内容。一份光线良好、300 DPI 的清晰扫描件,识别效果远胜于一张模糊的手机照片。如果结果不理想,先用更高的分辨率重新扫描再试一次。
拿到可搜索 PDF 之后能做什么
一旦你的文件有了真正的文字层,很多事情都变得可行。你可以在任何 PDF 阅读器里直接搜索和复制。你可以高亮和标注真实的文字,而不是在图像上画框框。你还可以把文件交给其他依赖可选中文字的工具。
如果你只需要纯文字——不要排版,只要可直接复制的文本——那就把这份可搜索文件交给 PDF to Text,得到干净的纯文本导出。如果你想在 Word 里编辑内容,正确的顺序是先做 OCR,再用 PDF to Word;不做 OCR 就直接把扫描件转成 Word,会得到一份空白或乱码的文档,因为根本没有文字可供它携带过去。
关于隐私的说明
OCR 比看起来要”重”得多——识别每一页上的每一个字符需要真正的计算能力——所以这个工具运行在我们的服务器上,而不是在你的浏览器里。你的 PDF 会通过加密的(HTTPS)连接发送,在安全服务器上处理,再返回给你。处理后它不会被存储、共享,也不会用于广告或训练,并且无需账号或邮箱。对于高度敏感的文件,在拿到所需的可搜索版本后,删除本地的工作副本仍然是个好习惯。
把扫描件数字化,过去意味着要么购买昂贵的桌面软件,要么手动逐页重新打字。现在你只需把文件拖进 OCR PDF,选好语言,不到一分钟就能下载一份完全可搜索的文档——免费,而且全程通过安全连接。把它收藏起来,下次再遇到一堆搜不了的扫描件时就能派上用场。
常见问题
什么是 OCR?我的扫描版 PDF 为什么需要它?
OCR(光学字符识别)会读取页面图像里的文字,把它们转换成真正可选中的字符。扫描件本质上只是一张文字的图片,所以如果不做 OCR,你没法在里面搜索、复制或高亮任何一个字。
OCR 会改变我扫描页面的外观吗?
不会。工具会在你原始的页面图像背后添加一个隐藏的文字层,所以扫描件看起来完全一样,而文字变得可搜索、可选中。清晰、高分辨率的扫描件能带来最准确的识别结果。
运行 OCR 时我的文件会被上传吗?
会的。OCR 需要真正的计算能力,所以你的 PDF 会通过加密的(HTTPS)连接被发送到我们的安全服务器进行识别,再返回给你。处理完后文件不会被存储或保留,也不需要注册账号或填写邮箱。