OCR для PDF – распознавание текста в сканах
Сделайте сканы PDF и фото доступными для поиска с помощью OCR на 15 языках. PDF с поиском или простой текст — распознавание в браузере без загрузки.
Как распознать текст в отсканированном PDF онлайн
Отсканированный документ — это просто картинка страницы: в нём нельзя искать, выделить фразу или скопировать число. OCR для PDF (оптическое распознавание символов) читает буквы на этой картинке и превращает их в настоящий текст. Можно сохранить исходный вид и добавить невидимый текстовый слой — получится PDF с возможностью поиска, — или просто скачать распознанный текст в файле .txt. Распознавание выполняется в вашем браузере открытым движком Tesseract, поэтому скан не покидает ваше устройство.
Как распознать текст в PDF
- Добавьте отсканированный PDF или изображение (PDF, JPG, PNG, WebP или BMP, до 100 МБ). Скриншот можно вставить через Ctrl+V.
- Выберите язык документа — по умолчанию это язык этой страницы. Для двуязычных документов добавьте второй язык, например русский и английский.
- Выберите результат: PDF с поиском или Простой текст. Для PDF можно ограничить OCR отдельными страницами, например 1-3, 7.
- Нажмите Распознать текст. При первом запуске загружаются языковые данные, затем они кэшируются. Прогресс отображается постранично.
- Скачайте файл-ocr.pdf или файл.txt.
Поддерживаемые языки
Английский, французский, испанский, немецкий, итальянский, португальский, русский, арабский, хинди, китайский упрощённый и традиционный, японский, корейский, турецкий и урду. Правильный выбор языка критически важен: он подсказывает движку, какой алфавит и какие слова ожидать. Добавляйте второй язык, только если он действительно есть в документе, — каждый дополнительный язык замедляет распознавание.
Как выглядит PDF с поиском
Страницы не изменяются и не пережимаются. Каждая страница для распознавания рендерится с разрешением до 300 DPI, а найденные слова размещаются невидимым слоем точно поверх напечатанных. Документ выглядит как прежде, но Ctrl+F находит слова, текст можно выделять и копировать, а системы поиска — индексировать файл.
Насколько точно распознавание?
- Лучший результат: чёткий печатный текст, скан 300 DPI, ровные страницы, хороший контраст.
- Результат хуже: размытые фото с телефона, очень мелкий шрифт, перекошенные страницы, цветной фон и декоративные шрифты.
- Не подходит: рукописный текст — Tesseract не читает его надёжно.
- Арабскому, хинди и китайскому обычно нужен более чёткий скан, чем латинице и кириллице.
Всегда проверяйте важные цифры, имена и даты.
Советы и связанные инструменты
- Фотографируете бумажные документы? Скан в PDF выровняет и очистит страницы перед OCR.
- Для структурированного текста после OCR конвертируйте PDF в PDF в Markdown.
- Если в PDF уже есть выделяемый текст, извлечение текста из PDF сработает мгновенно и точно.
Конфиденциально и бесплатно
Распознавание идёт на вашем компьютере или телефоне, поэтому договоры, документы и медицинские заключения никогда не отправляются в WoowPDF — загружается только языковая модель. Без регистрации, дневных лимитов и водяных знаков. Скорость зависит от устройства: несколько секунд на страницу на ноутбуке.
Возможности
- OCR на 15 языках, второй язык по желанию
- PDF с поиском и невидимым текстовым слоем
- Экспорт в простой текст (.txt) с метками страниц
- Сканы PDF и изображения JPG, PNG, WebP, BMP
- Все страницы или выбранный диапазон
- В браузере: файл не загружается
Частые вопросы
Что такое OCR для PDF?
Оптическое распознавание символов читает текст на отсканированных или сфотографированных страницах и превращает его в настоящие символы, по которым можно искать и копировать.
Загружается ли мой скан на сервер?
Нет. Распознавание выполняется в браузере с помощью Tesseract; один раз загружаются только языковые данные.
Какие языки поддерживаются?
Английский, французский, испанский, немецкий, итальянский, португальский, русский, арабский, хинди, китайский упрощённый и традиционный, японский, корейский, турецкий и урду; можно сочетать два языка.
Чем PDF с поиском отличается от простого текста?
PDF с поиском сохраняет ваши страницы и добавляет поверх невидимый текстовый слой. Простой текст содержит только распознанные слова в файле .txt.
Распознаётся ли рукописный текст?
Ненадёжно: движок обучен на печатном тексте.
Как повысить точность распознавания?
Используйте чёткий скан около 300 DPI, ровные страницы и правильный язык, не добавляя лишних языков.