Инструкция
Как извлечь текст из отсканированного PDF
Отсканированный PDF — это просто изображение текста, поэтому вы не можете выделять, искать, копировать или переводить его. Инструмент OCR PDF от DocTranslating превращает отсканированный или состоящий из картинок PDF в настоящий текстовый слой всего за несколько кликов: откройте инструмент, загрузите скан, при необходимости выберите язык документа для более быстрого и точного результата и нажмите «Извлечь текст». Поддерживается более 50 языков, рукописный ввод и языки с письмом справа налево, такие как арабский и иврит. Получив обработанный через OCR файл PDF, вы сможете переводить его, искать по нему или копировать текст, как в обычном документе.
Обновлено 19 июня 2026 г. · 8 мин чтения
Если вы пытались выделить текст в PDF, но ничего не подсвечивалось, или искали через Ctrl+F без результатов, ваш PDF отсканирован — это изображение страницы, а не текст. Именно поэтому перевод, копирование или редактирование не работают. Решение — технология оптического распознавания символов (OCR), которая считывает изображение и создает под ним настоящий текстовый слой. В этом руководстве показано, как сделать это с помощью инструмента OCR PDF от DocTranslating и что делать с полученным результатом.
Как узнать, отсканирован ли мой PDF?
Три быстрых способа проверить, требуется ли вашему PDF обработка OCR:
- Попробуйте выделить строку текста. Если курсор не выделяет отдельные слова — или выбирает всю страницу как единое изображение —, файл отсканирован.
- Воспользуйтесь поиском Ctrl+F (или Cmd+F на Mac). Если слово, которое вы четко видите на экране, не находится через поиск, в документе нет текстового слоя.
- Обратите внимание на уведомление в приложении. При открытии сканированного файла в DocTranslating появляется баннер: «Похоже, этот документ отсканирован…» с кнопкой Открыть инструмент OCR PDF — приложение само определило отсутствие текстового слоя.
Пошагово: как извлечь текст из отсканированного PDF
- 1
Откройте инструмент OCR PDF
Перейдите непосредственно к инструменту OCR PDF или — если вы уже пытались перевести отсканированный файл — нажмите кнопку «Открыть инструмент OCR PDF» в уведомлении. Оба пути ведут к одному и тому же инструменту.
- 2
Загрузите отсканированный PDF
Выберите отсканированный или состоящий из изображений PDF, который хотите преобразовать. Это файл, текст в котором сейчас нельзя выделить или найти.
- 3
Укажите язык документа (опционально)
Если вы знаете язык документа, выберите его. Это необязательно — инструмент определяет язык автоматически —, но указание языка обеспечивает более быстрый и точный результат, особенно для нелатинских шрифтов (арабский, китайский, кириллица, деванагари) и рукописного текста.
- 4
Нажмите «Извлечь текст» и скачайте результат
Инструмент считывает страницы и воссоздает настоящий выделяемый текстовый слой, сохраняя исходный вид документа. Скачайте обработанный PDF — теперь вы можете выделять, искать и копировать текст, и он готов к переводу.
С чем отлично справляется инструмент OCR PDF
Движок OCR в DocTranslating — один из самых мощных на рынке, и он умеет намного больше, чем просто распознавать стандартный печатный английский текст:
- Более 50 языков — включая языки с нелатинскими алфавитами.
- Рукописный текст — распознается четкий почерк, а не только печатный шрифт.
- Письменность справа налево (RTL) — арабский, иврит и персидский обрабатываются с высокой точностью, включая правильный порядок чтения.
- Многоязычные страницы — документы, содержащие несколько языков на одной странице.
- Обычное качество сканирования — фотографии документов и стандартные офисные сканы, а не только идеальные планшетные сканы.
После OCR: переведите ваш документ
Как только вы получите обработанный через OCR файл PDF, его перевод ничем не отличается от перевода обычного PDF — загрузите его, выберите языки и движок перевода, а затем скачайте переведенную копию. Предварительное выполнение OCR в качестве отдельного шага дает огромное преимущество: вы можете прочитать и проверить извлеченный текст до перевода. Перевод непроверенного скана чреват накоплением двух типов ошибок (неверно распознанное слово становится уверенно неверно переведенным словом), поэтому предварительная проверка результатов OCR — лучший способ получить точный итоговый перевод.
Советы для получения лучших результатов OCR
Точность OCR сильно зависит от качества исходного скана. Несколько простых правил помогут заметно улучшить результат:
- Указывайте язык документа, если знаете его — это самый простой способ повысить точность и скорость.
- Используйте четкие и ровные сканы. Пересканируйте перекошенные или повернутые страницы, чтобы текст располагался строго по горизонтальным линиям.
- Выбирайте более высокое разрешение. Сканы с разрешением около 300 DPI и выше дают распознавателю более четкие символы по сравнению с изображениями низкого качества.
- Увеличьте контрастность блеклых документов, чтобы текст четко выделялся на фоне.
- Убедитесь, что файл не защищен паролем — зашифрованные PDF невозможно прочитать до снятия защиты.
Альтернатива: OCR на PDFEquips
Если вы уже работаете в PDFEquips — например, конвертируете, сжимаете или объединяете PDF —, там также есть инструмент OCR, с помощью которого можно сделать скан PDF распознаваемым. Любой из вариантов даст вам обработанный файл, который затем можно перевести в DocTranslating. Используйте тот инструмент, который удобнее для вашего рабочего процесса.
Часто задаваемые вопросы
Как извлечь текст из отсканированного PDF?
Откройте инструмент OCR PDF от DocTranslating, загрузите скан PDF, при необходимости выберите язык документа для более быстрого и точного результата и нажмите «Извлечь текст». Инструмент воссоздает настоящий выделяемый текстовый слой, сохраняя исходный вид документа, и позволяет скачать обработанный PDF, в котором можно выделять, искать, копировать и переводить текст.
Как узнать, отсканирован ли PDF или содержит настоящий текст?
Попробуйте выделить строку текста курсором или поищите слово в документе через Ctrl+F (Cmd+F на Mac). Если не получается выделить отдельные слова или видимое слово не находится через поиск, PDF отсканирован и требует OCR. В DocTranslating при открытии сканированного файла также появляется уведомление «Похоже, этот документ отсканирован…» с кнопкой открытия инструмента OCR PDF.
Может ли инструмент извлечь рукописный текст из PDF?
Да. Инструмент OCR PDF распознает рукописный текст наряду с печатным. Четкий и разборчивый почерк дает наилучшие результаты; слишком небрежный или каллиграфический почерк сложно обработать любой системе OCR, поэтому результат зависит от разборчивости.
Работает ли OCR для арабского, иврита и других языков с письмом справа налево?
Да. Инструмент OCR PDF поддерживает языки с письмом справа налево (RTL), включая арабский, иврит и персидский, и восстанавливает правильный порядок чтения — самую сложную часть при обработке отсканированных RTL-документов. Благодаря этому извлеченный текст можно полноценно искать и переводить, а не получать набор перепутанных букв.
Сколько языков поддерживает инструмент OCR PDF?
Более 50 языков, включая многие языки с нелатинскими алфавитами. Вы можете доверить автоматическое определение языка системе или выбрать его вручную для более быстрого и точного извлечения — выбор языка особенно полезен для рукописных и нелатинских документов.
Нужно ли запускать OCR перед переводом отсканированного PDF?
Это рекомендуемый подход. Выполнение OCR как первого отдельного шага позволяет проверить правильность извлеченного текста до перевода, предотвращая перенос ошибок распознавания на другой язык. Получив обработанный PDF, переводите его как обычный файл.
Изменит ли OCR внешний вид моего документа?
Нет — инструмент OCR PDF сохраняет исходный внешний вид документа и добавляет поверх него слой выделяемого текста. Ваш скан будет выглядеть точно так же; единственная разница заключается в том, что текст теперь можно выделять, искать, копировать и переводить.
Почему Google Переводчик или другие сервисы не переводят мой отсканированный PDF?
Большинство переводчиков считывают только существующий текстовый слой PDF, а в отсканированном PDF его нет — это просто картинка. Поэтому такие сервисы возвращают пустой файл или ошибку. Извлечение текста с помощью OCR сначала создает в документе настоящий текстовый слой, после чего его можно нормально перевести.