Перейти к содержимому
WoowPDF

OCR для PDF – распознавание текста в сканах

Сделайте сканы PDF и фото доступными для поиска с помощью OCR на 15 языках. PDF с поиском или простой текст — распознавание в браузере без загрузки.

Бесплатно Работает в браузере

Как распознать текст в отсканированном PDF онлайн

Отсканированный документ — это просто картинка страницы: в нём нельзя искать, выделить фразу или скопировать число. OCR для PDF (оптическое распознавание символов) читает буквы на этой картинке и превращает их в настоящий текст. Можно сохранить исходный вид и добавить невидимый текстовый слой — получится PDF с возможностью поиска, — или просто скачать распознанный текст в файле .txt. Распознавание выполняется в вашем браузере открытым движком Tesseract, поэтому скан не покидает ваше устройство.

Как распознать текст в PDF

  1. Добавьте отсканированный PDF или изображение (PDF, JPG, PNG, WebP или BMP, до 100 МБ). Скриншот можно вставить через Ctrl+V.
  2. Выберите язык документа — по умолчанию это язык этой страницы. Для двуязычных документов добавьте второй язык, например русский и английский.
  3. Выберите результат: PDF с поиском или Простой текст. Для PDF можно ограничить OCR отдельными страницами, например 1-3, 7.
  4. Нажмите Распознать текст. При первом запуске загружаются языковые данные, затем они кэшируются. Прогресс отображается постранично.
  5. Скачайте файл-ocr.pdf или файл.txt.

Поддерживаемые языки

Английский, французский, испанский, немецкий, итальянский, португальский, русский, арабский, хинди, китайский упрощённый и традиционный, японский, корейский, турецкий и урду. Правильный выбор языка критически важен: он подсказывает движку, какой алфавит и какие слова ожидать. Добавляйте второй язык, только если он действительно есть в документе, — каждый дополнительный язык замедляет распознавание.

Как выглядит PDF с поиском

Страницы не изменяются и не пережимаются. Каждая страница для распознавания рендерится с разрешением до 300 DPI, а найденные слова размещаются невидимым слоем точно поверх напечатанных. Документ выглядит как прежде, но Ctrl+F находит слова, текст можно выделять и копировать, а системы поиска — индексировать файл.

Насколько точно распознавание?

  • Лучший результат: чёткий печатный текст, скан 300 DPI, ровные страницы, хороший контраст.
  • Результат хуже: размытые фото с телефона, очень мелкий шрифт, перекошенные страницы, цветной фон и декоративные шрифты.
  • Не подходит: рукописный текст — Tesseract не читает его надёжно.
  • Арабскому, хинди и китайскому обычно нужен более чёткий скан, чем латинице и кириллице.

Всегда проверяйте важные цифры, имена и даты.

Советы и связанные инструменты

  • Фотографируете бумажные документы? Скан в PDF выровняет и очистит страницы перед OCR.
  • Для структурированного текста после OCR конвертируйте PDF в PDF в Markdown.
  • Если в PDF уже есть выделяемый текст, извлечение текста из PDF сработает мгновенно и точно.

Конфиденциально и бесплатно

Распознавание идёт на вашем компьютере или телефоне, поэтому договоры, документы и медицинские заключения никогда не отправляются в WoowPDF — загружается только языковая модель. Без регистрации, дневных лимитов и водяных знаков. Скорость зависит от устройства: несколько секунд на страницу на ноутбуке.

Возможности

  • OCR на 15 языках, второй язык по желанию
  • PDF с поиском и невидимым текстовым слоем
  • Экспорт в простой текст (.txt) с метками страниц
  • Сканы PDF и изображения JPG, PNG, WebP, BMP
  • Все страницы или выбранный диапазон
  • В браузере: файл не загружается

Частые вопросы

Что такое OCR для PDF?

Оптическое распознавание символов читает текст на отсканированных или сфотографированных страницах и превращает его в настоящие символы, по которым можно искать и копировать.

Загружается ли мой скан на сервер?

Нет. Распознавание выполняется в браузере с помощью Tesseract; один раз загружаются только языковые данные.

Какие языки поддерживаются?

Английский, французский, испанский, немецкий, итальянский, португальский, русский, арабский, хинди, китайский упрощённый и традиционный, японский, корейский, турецкий и урду; можно сочетать два языка.

Чем PDF с поиском отличается от простого текста?

PDF с поиском сохраняет ваши страницы и добавляет поверх невидимый текстовый слой. Простой текст содержит только распознанные слова в файле .txt.

Распознаётся ли рукописный текст?

Ненадёжно: движок обучен на печатном тексте.

Как повысить точность распознавания?

Используйте чёткий скан около 300 DPI, ровные страницы и правильный язык, не добавляя лишних языков.

Нужно что-то другое?