OCR de PDF – Torne PDFs digitalizados pesquisáveis
Torne PDFs digitalizados e fotos pesquisáveis com OCR em 15 idiomas. PDF pesquisável ou texto simples, reconhecido no navegador sem enviar nada.
Como fazer OCR em um PDF digitalizado online
Um documento digitalizado é apenas uma imagem da página: não dá para pesquisar, selecionar uma frase ou copiar um número. O OCR de PDF (reconhecimento óptico de caracteres) lê as letras dessa imagem e as transforma em texto de verdade. Você pode manter a aparência original e adicionar uma camada de texto invisível, criando um PDF pesquisável, ou apenas baixar o texto reconhecido em um arquivo .txt. O reconhecimento acontece no seu navegador com o mecanismo livre Tesseract, então a digitalização nunca sai do seu dispositivo.
Como fazer OCR em um PDF
- Adicione um PDF digitalizado ou uma imagem (PDF, JPG, PNG, WebP ou BMP, até 100 MB). Também é possível colar uma captura de tela com Ctrl+V.
- Escolha o idioma do documento, que por padrão é o desta página, e adicione um segundo idioma se o documento for bilíngue.
- Escolha a saída: PDF pesquisável ou Texto simples. Em um PDF, você pode limitar o OCR a algumas páginas, como 1-3, 7.
- Clique em Reconhecer texto. Na primeira vez os dados do idioma são baixados e depois ficam em cache. O progresso aparece página por página.
- Baixe arquivo-ocr.pdf ou arquivo.txt.
Idiomas disponíveis
Inglês, francês, espanhol, alemão, italiano, português, russo, árabe, hindi, chinês simplificado e tradicional, japonês, coreano, turco e urdu. Escolher o idioma certo é fundamental: ele diz ao mecanismo qual alfabeto e quais palavras esperar. Só adicione um segundo idioma se o documento realmente o tiver, pois cada idioma extra deixa o processo mais lento.
Como fica o PDF pesquisável
Suas páginas não são alteradas nem recomprimidas. Cada página é renderizada a até 300 DPI para o reconhecimento, e as palavras reconhecidas são posicionadas como camada invisível exatamente sobre as impressas. O documento fica igual, mas o Ctrl+F encontra palavras, você pode destacar e copiar, e sistemas de busca conseguem indexar o arquivo.
Qual a precisão?
- Melhores resultados: texto impresso nítido, digitalizado a 300 DPI, páginas retas e bom contraste.
- Resultados mais fracos: fotos borradas, letras muito pequenas, páginas tortas, fundos coloridos e fontes decorativas.
- Não indicado: letra de mão, que o Tesseract não lê de forma confiável.
- Árabe, hindi e chinês costumam exigir uma digitalização mais nítida que o alfabeto latino.
Revise sempre números, nomes e datas importantes.
Dicas e ferramentas relacionadas
- Fotografando documentos em papel? O Digitalizar para PDF endireita e limpa as páginas antes do OCR.
- Para texto estruturado, converta depois o PDF pesquisável com PDF para Markdown.
- Se o PDF já tem texto selecionável, o extrator de texto de PDF é instantâneo e exato.
Privado e grátis
O reconhecimento acontece no seu computador ou celular, então contratos, documentos de identidade ou laudos médicos nunca são enviados ao WoowPDF. Só o modelo de idioma é baixado. Sem cadastro, sem limite diário e sem marca d'água. A velocidade depende do aparelho: alguns segundos por página em um notebook.
Recursos
- OCR em 15 idiomas, com segundo idioma opcional
- PDF pesquisável com camada de texto invisível
- Exportação em texto simples (.txt) com marcadores de página
- PDFs digitalizados e imagens JPG, PNG, WebP e BMP
- Todas as páginas ou um intervalo escolhido
- No navegador: o arquivo não é enviado
Perguntas frequentes
O que é OCR de PDF?
O reconhecimento óptico de caracteres lê o texto de páginas digitalizadas ou fotografadas e o transforma em caracteres reais, que podem ser pesquisados e copiados.
Meu documento digitalizado é enviado?
Não. O reconhecimento acontece no seu navegador com o Tesseract; só os dados de idioma são baixados uma vez.
Quais idiomas são reconhecidos?
Inglês, francês, espanhol, alemão, italiano, português, russo, árabe, hindi, chinês simplificado e tradicional, japonês, coreano, turco e urdu, combináveis dois a dois.
Qual a diferença entre PDF pesquisável e texto simples?
O PDF pesquisável mantém suas páginas e adiciona uma camada de texto invisível. O texto simples entrega apenas as palavras reconhecidas em um .txt.
Reconhece letra de mão?
Não de forma confiável: o mecanismo é treinado com texto impresso.
Como melhorar a precisão?
Use uma digitalização nítida de cerca de 300 DPI, páginas retas e o idioma correto, sem idiomas extras desnecessários.