操作指南
如何从扫描版 PDF 中提取文本
扫描版 PDF 本质上只是文本的图片,这意味着您无法对其进行选择、搜索、复制或翻译。DocTranslating 的 OCR PDF 工具只需点击几下,即可将扫描版或基于图片的 PDF 转换为真实的、可选择的文本层:打开工具,上传扫描文件,(可选)设置文档语言以获得更快更准确的结果,然后点击“提取文本”。它支持 50+ 种语言、手写文本以及阿拉伯语和希伯来语等从右至左(RTL)的书写系统。获得 OCR 处理后的 PDF 后,您可以像对待普通文档一样对其进行翻译、搜索或复制文本。
更新于 2026年6月19日 · 8 分钟阅读
如果您曾尝试在 PDF 中选择文本却没有任何高亮,或者按 Ctrl+F 搜索却找不到任何结果,那么您的 PDF 就是扫描件——它是页面图像,而非文本。这就是为什么翻译、复制或编辑无法生效的原因。解决方案是光学字符识别(OCR)技术,它读取图像并在其下方构建一个真实的文本层。本指南将向您展示如何使用 DocTranslating 的 OCR PDF 工具完成此操作,以及如何处理提取出的结果。
如何判断我的 PDF 是否是扫描件?
通过以下三个快速检查,可以确定 PDF 是否需要 OCR:
- 尝试选择一行文本。如果您的光标无法高亮显示单个词语——或者将整个页面作为单张图片选中——则该文档为扫描件。
- 按 Ctrl+F(Mac 上为 Cmd+F)进行搜索。如果屏幕上清晰可见的词语在搜索中找不到,则说明没有可搜索的文本层。
- 注意应用内的通知。当您在 DocTranslating 中打开扫描文件时,会出现一个通知横幅,显示“此文档似乎是扫描件……”以及一个打开 OCR PDF 工具按钮——说明应用已检测到缺乏可用的文本层。
分步指南:从扫描版 PDF 中提取文本
- 1
打开 OCR PDF 工具
直接前往 OCR PDF 工具,或者——如果您已经在尝试翻译扫描文件——点击通知中的“打开 OCR PDF 工具”按钮。两条路径均通向同一工具。
- 2
上传您的扫描版 PDF
选择您想要转换的扫描版或图片型 PDF 文件。这是目前文本无法选择或搜索的文件。
- 3
设置文档语言(可选)
如果您知道文档的语言,请选择该语言。这是可选的——工具会自动检测语言——但设置语言可以确保更快、更准确的结果,特别是对于阿拉伯语、中文、西里尔字母或梵文等非拉丁字母以及手写文本。
- 4
点击“提取文本”并下载结果
该工具会读取页面并在保留文档原始外观的同时重建真实的、可选择的文本层。下载 OCR 处理后的 PDF——现在您可以选择、搜索和复制其中的文本,且已准备好进行翻译。
OCR PDF 工具的卓越之处
DocTranslating 的 OCR 引擎是目前最强大的引擎之一,远不止处理简单的英文印刷体:
- 50+ 种语言——包括采用非拉丁字母的语言。
- 手写文本——可识别清晰的手写体,不仅仅是印刷体。
- 从右至左(RTL)书写系统——高精度处理阿拉伯语、希伯来语和波斯语,包括重建正确的阅读顺序。
- 多语言页面——在同一页面上包含多种语言的文档。
- 日常扫描质量——支持文档照片和普通的日常办公扫描件,不仅仅是完美的平板扫描件。
完成 OCR 后:翻译您的文档
一旦您获得了经过 OCR 处理的 PDF,翻译它就与翻译普通 PDF 完全一样——上传文件,选择语言和翻译引擎,然后下载翻译好的副本。将 OCR 作为独立的第一步执行有一个重大优势:您可以在翻译之前核对提取文本的准确性。直接翻译未核对的扫描件可能会叠加两种错误——识别错误的词会自信地变成翻译错误的词——因此先检查 OCR 结果是获得精准最终译文的最佳方式。
获得最佳 OCR 效果的实用技巧
OCR 的准确度很大程度上取决于输入扫描件的质量。以下几点可以显著提升效果:
- 如果已知,请设置文档语言——这是提高准确度和速度最简单的方法。
- 使用清晰且摆正的扫描件。对倾斜或旋转的页面进行重新扫描,使文本保持在水平线上。
- 优先选择更高分辨率。与低分辨率图像相比,大约 300 DPI 或更高的扫描件能为 OCR 引擎提供更清晰的字符。
- 增强字迹模糊文档的对比度,使文本从背景中清晰突出。
- 确保文件未设置密码保护——加密的 PDF 在解锁前无法被读取。
替代方案:在 PDFEquips 上使用 OCR
如果您已经在 PDFEquips 上工作——例如转换、压缩或合并 PDF——它同样提供 OCR 工具,供您让扫描版 PDF 变得可搜索。无论哪种途径,都能为您提供一份经过 OCR 处理的文件,随后您可以将其导入 DocTranslating 进行翻译。选择最符合您工作流程的方案即可。
常见问题
如何从扫描版 PDF 中提取文本?
打开 DocTranslating 的 OCR PDF 工具,上传您的扫描版 PDF,(可选)设置文档语言以获得更快更准确的结果,然后点击“提取文本”。该工具会在保留文档原始外观的同时重建真实的、可选择的文本层,并允许您下载可供选择、搜索、复制和翻译的 OCR PDF。
如何判断 PDF 是扫描件还是包含真实文本?
尝试用光标选择一行文本,或者使用 Ctrl+F(Mac 上为 Cmd+F)在文档中搜索。如果您无法高亮显示单个词语,或者清晰可见的词语无法被搜索到,则该 PDF 为扫描件,需要进行 OCR 处理。在 DocTranslating 中打开扫描文件时,还会弹出“此文档似乎是扫描件……”的通知并附带打开 OCR 工具的按钮。
它可以从 PDF 中提取手写文本吗?
可以。OCR PDF 工具除了识别印刷体外,还能识别手写文本。清晰易读的手写体效果最好;而过于潦草或艺术化的手写体对任何 OCR 系统都是一项挑战,因此效果会因清晰度而异。
OCR 是否适用于阿拉伯语、希伯来语等从右至左书写的语言?
是的。OCR PDF 工具支持包含阿拉伯语、希伯来语和波斯语在内的从右至左(RTL)书写系统,并能重建正确的阅读顺序——这通常是扫描版 RTL 文档中最难处理的部分。这使得提取出的文本真正可用于搜索和翻译,而不会混乱。
OCR PDF 工具支持多少种语言?
支持 50+ 种语言,包括许多采用非拉丁字母的语言。您可以让工具自动检测语言,也可以手动指定语言以获得更快、更准确的提取效果——对于非拉丁字母和手写文档,手动指定语言尤其有帮助。
在翻译扫描版 PDF 之前必须先运行 OCR 吗?
这是推荐的做法。将 OCR 作为独立的第一步运行,可以让您在翻译之前核对提取文本的准确性,防止识别错误带入另一种语言。拿到经过 OCR 处理的 PDF 后,即可像普通 PDF 一样进行翻译。
OCR 会改变我文档的外观吗?
不会——OCR PDF 工具会保留文档的原貌,并在其上方叠加一层可选择的文本。您的扫描文件外观与之前完全一致;唯一的区别是其中的文本现在可以被选择、搜索、复制和翻译。
为什么谷歌翻译或其他工具无法翻译我的扫描版 PDF?
大多数翻译工具只能读取 PDF 中现有的文本层,而扫描版 PDF 没有文本层——它只是一张图片。这就是为什么这些工具会返回空白文件或报错。先通过 OCR 提取文本可以为文档赋予真实的文本层,之后就可以正常翻译了。