如何对 PDF 进行 OCR(让它可搜索)
分步教你用 OCR 让扫描版 PDF 可搜索:选择文档语言,文字层在浏览器本地添加,文件无需上传。
识别文字扫描版 PDF 就像文字的照片:看起来能读,但对任何一个搜索框、复制粘贴或文字提取工具来说,页面都是空的。OCR(光学字符识别)能识别出字母,并在扫描图像之上加一层隐形文字层,从而解决这个问题。本指南介绍如何用 AmiPDF 的 OCR PDF 工具完成这件事:全部识别都在你的浏览器里进行,文件不会离开你的设备,这对合同、病历和身份证件尤其重要。你选择一种或多种文档语言,工具逐页识别,输出的还是同一个 PDF,只是现在可以搜索和复制了。
运行 OCR 的分步操作
打开 OCR 工具并添加扫描件
进入 AmiPDF OCR PDF 工具,把扫描版 PDF 拖到上传区域。扫描文档只要在工具的页数上限内都可以处理;如果扫描的是一本厚书,先用 拆分 PDF 切成几部分,再逐块处理。

选择文档语言
选中文档中出现的每一种语言,数量以每次运行的上限为准。当文本确实混用多种语言时,选两三种能提升识别效果;添加文档里没有的语言只会拖慢运行速度。识别引擎和语言包在首次使用时下载一次,之后会缓存。

开始识别
点击开始,观察每页进度。识别通过 WebAssembly 在你的设备上进行;一份 10 页的扫描件通常需要几分钟,具体取决于你的机器。运行期间请保持标签页打开;工具会自动拼装输出结果。

下载可搜索的 PDF
保存结果;视觉上还是同一份文档,只是下面多了一层隐形文字层。任何 PDF 阅读器里都能搜索,复制粘贴能得到真正的文字,之后还可以用 PDF 转 Markdown 把内容提取出来。页面上还有一个按钮,可把识别出的原始文本导出为 .txt 文件,便于快速核对。

获得最佳效果
清晰的扫描件识别效果更好
页面摆正、光照均匀、300 DPI 是最理想的状态。用手机斜着拍的照片,边缘处准确率会下降;如果来源是手机相机,先校正并裁剪;裁剪 PDF 工具可以裁掉会干扰识别的深色边框。
检查文本预览
OCR 是统计式的:无法保证 100% 准确,遇到特殊字体或低对比度时更是如此。依赖搜索之前,先用提取文本视图抽查几段,如果结果看起来乱码,就调整语言后重新运行。
文本型 PDF 不必 OCR
如果工具提示文档已经有文字层,就不需要 OCR;像 PDF 转 Word 这样的提取工具可以直接处理,几秒钟就能完成。
常见问题
我的文件真的不会被上传到任何地方吗?
是的,识别通过 WebAssembly 在你的浏览器里运行。唯一的网络流量是首次下载 OCR 引擎和语言包,之后会缓存以供后续使用。
最多可以选择多少种语言?
以页面上显示的每次运行上限为准。可以自由混选语言,例如一份双语合同里同时选英语和中文,但不要选文档里没有的语言;它们只会拖慢运行速度。
OCR 会改变扫描件的外观吗?
不会。页面保持原来的样子;识别出的文字以隐形层的形式加在扫描图像下方。你看到的还是同一份文档,只是现在可以搜索和复制了。