Инструкция

Как извлечь текст из отсканированного PDF

Извлечение выделяемого текста из отсканированного PDF с помощью OCR и последующий перевод результата

Отсканированный PDF — это просто изображение текста, поэтому вы не можете выделять, искать, копировать или переводить его. Инструмент OCR PDF от DocTranslating превращает отсканированный или состоящий из картинок PDF в настоящий текстовый слой всего за несколько кликов: откройте инструмент, загрузите скан, при необходимости выберите язык документа для более быстрого и точного результата и нажмите «Извлечь текст». Поддерживается более 50 языков, рукописный ввод и языки с письмом справа налево, такие как арабский и иврит. Получив обработанный через OCR файл PDF, вы сможете переводить его, искать по нему или копировать текст, как в обычном документе.

Обновлено 19 июня 2026 г. · 8 мин чтения

Если вы пытались выделить текст в PDF, но ничего не подсвечивалось, или искали через Ctrl+F без результатов, ваш PDF отсканирован — это изображение страницы, а не текст. Именно поэтому перевод, копирование или редактирование не работают. Решение — технология оптического распознавания символов (OCR), которая считывает изображение и создает под ним настоящий текстовый слой. В этом руководстве показано, как сделать это с помощью инструмента OCR PDF от DocTranslating и что делать с полученным результатом.

Как узнать, отсканирован ли мой PDF?

Три быстрых способа проверить, требуется ли вашему PDF обработка OCR:

Пошагово: как извлечь текст из отсканированного PDF

  1. 1

    Откройте инструмент OCR PDF

    Перейдите непосредственно к инструменту OCR PDF или — если вы уже пытались перевести отсканированный файл — нажмите кнопку «Открыть инструмент OCR PDF» в уведомлении. Оба пути ведут к одному и тому же инструменту.

  2. 2

    Загрузите отсканированный PDF

    Выберите отсканированный или состоящий из изображений PDF, который хотите преобразовать. Это файл, текст в котором сейчас нельзя выделить или найти.

  3. 3

    Укажите язык документа (опционально)

    Если вы знаете язык документа, выберите его. Это необязательно — инструмент определяет язык автоматически —, но указание языка обеспечивает более быстрый и точный результат, особенно для нелатинских шрифтов (арабский, китайский, кириллица, деванагари) и рукописного текста.

  4. 4

    Нажмите «Извлечь текст» и скачайте результат

    Инструмент считывает страницы и воссоздает настоящий выделяемый текстовый слой, сохраняя исходный вид документа. Скачайте обработанный PDF — теперь вы можете выделять, искать и копировать текст, и он готов к переводу.

С чем отлично справляется инструмент OCR PDF

Движок OCR в DocTranslating — один из самых мощных на рынке, и он умеет намного больше, чем просто распознавать стандартный печатный английский текст:

После OCR: переведите ваш документ

Как только вы получите обработанный через OCR файл PDF, его перевод ничем не отличается от перевода обычного PDF — загрузите его, выберите языки и движок перевода, а затем скачайте переведенную копию. Предварительное выполнение OCR в качестве отдельного шага дает огромное преимущество: вы можете прочитать и проверить извлеченный текст до перевода. Перевод непроверенного скана чреват накоплением двух типов ошибок (неверно распознанное слово становится уверенно неверно переведенным словом), поэтому предварительная проверка результатов OCR — лучший способ получить точный итоговый перевод.

Советы для получения лучших результатов OCR

Точность OCR сильно зависит от качества исходного скана. Несколько простых правил помогут заметно улучшить результат:

Альтернатива: OCR на PDFEquips

Если вы уже работаете в PDFEquips — например, конвертируете, сжимаете или объединяете PDF —, там также есть инструмент OCR, с помощью которого можно сделать скан PDF распознаваемым. Любой из вариантов даст вам обработанный файл, который затем можно перевести в DocTranslating. Используйте тот инструмент, который удобнее для вашего рабочего процесса.

Часто задаваемые вопросы

Как извлечь текст из отсканированного PDF?

Откройте инструмент OCR PDF от DocTranslating, загрузите скан PDF, при необходимости выберите язык документа для более быстрого и точного результата и нажмите «Извлечь текст». Инструмент воссоздает настоящий выделяемый текстовый слой, сохраняя исходный вид документа, и позволяет скачать обработанный PDF, в котором можно выделять, искать, копировать и переводить текст.

Как узнать, отсканирован ли PDF или содержит настоящий текст?

Попробуйте выделить строку текста курсором или поищите слово в документе через Ctrl+F (Cmd+F на Mac). Если не получается выделить отдельные слова или видимое слово не находится через поиск, PDF отсканирован и требует OCR. В DocTranslating при открытии сканированного файла также появляется уведомление «Похоже, этот документ отсканирован…» с кнопкой открытия инструмента OCR PDF.

Может ли инструмент извлечь рукописный текст из PDF?

Да. Инструмент OCR PDF распознает рукописный текст наряду с печатным. Четкий и разборчивый почерк дает наилучшие результаты; слишком небрежный или каллиграфический почерк сложно обработать любой системе OCR, поэтому результат зависит от разборчивости.

Работает ли OCR для арабского, иврита и других языков с письмом справа налево?

Да. Инструмент OCR PDF поддерживает языки с письмом справа налево (RTL), включая арабский, иврит и персидский, и восстанавливает правильный порядок чтения — самую сложную часть при обработке отсканированных RTL-документов. Благодаря этому извлеченный текст можно полноценно искать и переводить, а не получать набор перепутанных букв.

Сколько языков поддерживает инструмент OCR PDF?

Более 50 языков, включая многие языки с нелатинскими алфавитами. Вы можете доверить автоматическое определение языка системе или выбрать его вручную для более быстрого и точного извлечения — выбор языка особенно полезен для рукописных и нелатинских документов.

Нужно ли запускать OCR перед переводом отсканированного PDF?

Это рекомендуемый подход. Выполнение OCR как первого отдельного шага позволяет проверить правильность извлеченного текста до перевода, предотвращая перенос ошибок распознавания на другой язык. Получив обработанный PDF, переводите его как обычный файл.

Изменит ли OCR внешний вид моего документа?

Нет — инструмент OCR PDF сохраняет исходный внешний вид документа и добавляет поверх него слой выделяемого текста. Ваш скан будет выглядеть точно так же; единственная разница заключается в том, что текст теперь можно выделять, искать, копировать и переводить.

Почему Google Переводчик или другие сервисы не переводят мой отсканированный PDF?

Большинство переводчиков считывают только существующий текстовый слой PDF, а в отсканированном PDF его нет — это просто картинка. Поэтому такие сервисы возвращают пустой файл или ошибку. Извлечение текста с помощью OCR сначала создает в документе настоящий текстовый слой, после чего его можно нормально перевести.

How-to

Как перевести отсканированный PDF-файл

Отсканированные PDF — это изображения текста, а не настоящий текст; именно поэтому большинство переводчиков, включая Google Переводчик, отклоняют их, возвращают пустой файл или выдают ошибку "не удалось перевести этот файл". Чтобы перевести отсканированный PDF, вам нужно распознавание текста (OCR) перед переводом. DocTranslating автоматически запускает OCR в процессе перевода, поддерживает более 100 языков и собирает переведенный текст обратно в копию, идентичную исходному PDF. Для точной работы с важными документами сначала проверьте результат OCR на PDFEquips, чтобы ошибки распознавания текста не накладывались на ошибки перевода.

8 min read

Первые шаги

Как перевести документ без потери форматирования

DocTranslating переводит файлы PDF, Word, PowerPoint, Excel, код и субтитры на более чем 100 языков с сохранением исходного макета, шрифтов, таблиц и изображений. Загрузите файл, выберите язык и один из четырех движков перевода (DeepL, Microsoft Azure, Google Cloud или Gemini), а затем скачайте копию, идентичную оригиналу. В этом руководстве описан весь процесс, а также особые случаи из практики: отсканированные PDF, сноски и текстовые блоки, согласованность терминологии, ограничения на размер файлов и языки с письмом справа налево (RTL).

11 min read

← Все руководства