Как извлечь текст из сканированного PDF

Сканированный PDF это стопка изображений страниц, поэтому выделить или скопировать текст нельзя. Чтобы достать слова, нужен OCR. Бесплатный инструмент PDF в текст делает обе вещи прямо в браузере: напрямую читает текстовый слой цифровых страниц и запускает распознавание только для страниц-картинок.

Почему не копируется текст из PDF?

Чаще всего потому, что страница это скан или фото, сохранённое в PDF. Файл показывает буквы, но внутри только пиксели. В некоторых PDF автор также запретил копирование. Если нельзя выделить отдельное слово, странице нужен OCR, прежде чем текст можно будет скопировать.

Как понять, что PDF сканированный?

Откройте его и попробуйте выделить предложение. Если слова выделяются по одному, у страницы есть текстовый слой. Если вся страница выделяется как картинка или ничего не выделяется, это скан. Многие PDF смешанные: набранные страницы и несколько отсканированных приложений в конце.

Как бесплатно распознать текст в PDF?

  1. Откройте инструментПерейдите в PDF в текст.
  2. Добавьте PDFВыберите файл размером до 50 МБ.
  3. Выберите язык OCRУкажите язык документа, чтобы отсканированные страницы распознались правильно.
  4. Извлеките текстСтраницы с текстовым слоем готовы сразу, отсканированные распознаются по одной.
  5. Скопируйте или скачайтеСкопируйте результат или сохраните его текстовым файлом.

Как привести извлечённый текст в порядок?

В сканах предложения часто обрываются в конце каждой печатной строки, а слова переносятся через дефис. Если вы обрабатываете текст программно, несколько строк JavaScript снова соберут абзацы. Вставьте результат OCR в переменную text и запустите код в консоли браузера или в Node.js.

join-ocr-lines.js
const text = `вставьте сюда результат OCR`;

const cleaned = text
  .replace(/-\n(?=\p{Ll})/gu, '')   // склеить слова с переносом
  .replace(/(?<!\n)\n(?!\n)/g, ' ') // одиночные переводы строки -> пробелы
  .replace(/[ \t]{2,}/g, ' ');      // повторные пробелы -> один

console.log(cleaned);

Безопасно ли это для конфиденциальных документов?

Да. PDF обрабатывается вашим собственным браузером и никогда не загружается на сервер, так что инструмент подходит для договоров, счетов и медицинских документов. Чем лучше скан, тем лучше текст: прочитайте, от чего на самом деле зависит точность OCR, прежде чем пересканировать.

А если у меня только фотографии страниц?

Тогда пропустите шаг с PDF и сразу используйте инструменты для изображений: скопируйте текст с картинки для одной страницы или пакетное распознавание для 20 страниц сразу.

Извлеките текст из вашего PDF

Сначала текстовый слой, затем OCR для сканов. Всё в браузере.

Похожие статьи

October 4, 2026
Инструкция
Arbab Naseer

Как распознать номер телефона и email с фото

Достаньте номера телефонов и email с фото, листовки или скриншота с помощью бесплатного OCR в браузере и скопируйте их, не перепечатывая ни одной цифры.

October 4, 2026
Инструкция
Arbab Naseer

Как скопировать текст с картинки на iPhone, Android, Windows и Mac

Скопируйте текст с картинки на iPhone, Android, Windows или Mac встроенными средствами или бесплатным OCR в браузере, который везде работает одинаково.

October 3, 2026
Инструкция
Arbab Naseer

Как скопировать текст со скриншота

Превратите скриншот в редактируемый текст: вставьте его в бесплатный OCR в браузере и скопируйте результат. Горячие клавиши для Windows, Mac и телефона.

Вернуться в блог

We are also available in other languages

Ad Sponsored Check this offer
Ad Sponsored Check this offer