Как извлечь текст из сканированного PDF
Сканированный PDF это стопка изображений страниц, поэтому выделить или скопировать текст нельзя. Чтобы достать слова, нужен OCR. Бесплатный инструмент PDF в текст делает обе вещи прямо в браузере: напрямую читает текстовый слой цифровых страниц и запускает распознавание только для страниц-картинок.
Почему не копируется текст из PDF?
Чаще всего потому, что страница это скан или фото, сохранённое в PDF. Файл показывает буквы, но внутри только пиксели. В некоторых PDF автор также запретил копирование. Если нельзя выделить отдельное слово, странице нужен OCR, прежде чем текст можно будет скопировать.
Как понять, что PDF сканированный?
Откройте его и попробуйте выделить предложение. Если слова выделяются по одному, у страницы есть текстовый слой. Если вся страница выделяется как картинка или ничего не выделяется, это скан. Многие PDF смешанные: набранные страницы и несколько отсканированных приложений в конце.
Как бесплатно распознать текст в PDF?
- Откройте инструментПерейдите в PDF в текст.
- Добавьте PDFВыберите файл размером до 50 МБ.
- Выберите язык OCRУкажите язык документа, чтобы отсканированные страницы распознались правильно.
- Извлеките текстСтраницы с текстовым слоем готовы сразу, отсканированные распознаются по одной.
- Скопируйте или скачайтеСкопируйте результат или сохраните его текстовым файлом.
Как привести извлечённый текст в порядок?
В сканах предложения часто обрываются в конце каждой печатной строки, а слова переносятся через дефис. Если вы обрабатываете текст программно, несколько строк JavaScript снова соберут абзацы. Вставьте результат OCR в переменную text и запустите код в консоли браузера или в Node.js.
const text = `вставьте сюда результат OCR`;
const cleaned = text
.replace(/-\n(?=\p{Ll})/gu, '') // склеить слова с переносом
.replace(/(?<!\n)\n(?!\n)/g, ' ') // одиночные переводы строки -> пробелы
.replace(/[ \t]{2,}/g, ' '); // повторные пробелы -> один
console.log(cleaned);Безопасно ли это для конфиденциальных документов?
Да. PDF обрабатывается вашим собственным браузером и никогда не загружается на сервер, так что инструмент подходит для договоров, счетов и медицинских документов. Чем лучше скан, тем лучше текст: прочитайте, от чего на самом деле зависит точность OCR, прежде чем пересканировать.
А если у меня только фотографии страниц?
Тогда пропустите шаг с PDF и сразу используйте инструменты для изображений: скопируйте текст с картинки для одной страницы или пакетное распознавание для 20 страниц сразу.
Извлеките текст из вашего PDF
Сначала текстовый слой, затем OCR для сканов. Всё в браузере.