Як витягти текст зі сканованого PDF
Сканований PDF це стос зображень сторінок, тому виділити чи скопіювати текст неможливо. Щоб дістати слова, потрібен OCR. Безкоштовний інструмент PDF у текст робить обидві речі просто в браузері: напряму читає текстовий шар цифрових сторінок і запускає розпізнавання лише для сторінок-картинок.
Чому не копіюється текст з PDF?
Найчастіше тому, що сторінка це скан або фото, збережене в PDF. Файл показує літери, але всередині лише пікселі. У деяких PDF автор також заборонив копіювання. Якщо не вдається виділити окреме слово, сторінці потрібен OCR, перш ніж текст можна буде скопіювати.
Як зрозуміти, що PDF сканований?
Відкрийте його й спробуйте виділити речення. Якщо слова виділяються по одному, у сторінки є текстовий шар. Якщо вся сторінка виділяється як картинка або нічого не виділяється, це скан. Багато PDF змішані: набрані сторінки й кілька відсканованих додатків наприкінці.
Як безкоштовно розпізнати текст у PDF?
- Відкрийте інструментПерейдіть до PDF у текст.
- Додайте PDFВиберіть файл розміром до 50 МБ.
- Оберіть мову OCRВкажіть мову документа, щоб відскановані сторінки розпізналися правильно.
- Витягніть текстСторінки з текстовим шаром готові одразу, відскановані розпізнаються по одній.
- Скопіюйте або завантажтеСкопіюйте результат або збережіть його текстовим файлом.
Як упорядкувати витягнутий текст?
У сканах речення часто обриваються наприкінці кожного друкованого рядка, а слова переносяться через дефіс. Якщо ви обробляєте текст програмно, кілька рядків JavaScript знову зберуть абзаци. Вставте результат OCR у змінну text і запустіть код у консолі браузера чи в Node.js.
const text = `вставте сюди результат OCR`;
const cleaned = text
.replace(/-\n(?=\p{Ll})/gu, '') // склеїти слова з переносом
.replace(/(?<!\n)\n(?!\n)/g, ' ') // поодинокі переведення рядка -> пробіли
.replace(/[ \t]{2,}/g, ' '); // повторні пробіли -> один
console.log(cleaned);Чи безпечно це для конфіденційних документів?
Так. PDF обробляється вашим власним браузером і ніколи не завантажується на сервер, тож інструмент підходить для договорів, рахунків і медичних документів. Що кращий скан, то кращий текст: прочитайте, від чого насправді залежить точність OCR, перш ніж пересканувати.
А якщо в мене лише фотографії сторінок?
Тоді пропустіть крок із PDF і одразу використовуйте інструменти для зображень: скопіюйте текст з картинки для однієї сторінки або пакетне розпізнавання для 20 сторінок одразу.
Витягніть текст з вашого PDF
Спершу текстовий шар, потім OCR для сканів. Усе в браузері.