OCR para PDF – Haz buscable un PDF escaneado
Haz que tus PDF escaneados y fotos se puedan buscar con OCR en 15 idiomas. PDF con búsqueda o texto plano, reconocido en tu navegador sin subir nada.
Cómo hacer OCR a un PDF escaneado online
Un documento escaneado es solo una imagen de la página: no puedes buscar en él, seleccionar una frase ni copiar una cifra. El OCR para PDF (reconocimiento óptico de caracteres) lee las letras de esa imagen y las convierte en texto real. Puedes conservar el aspecto original y añadir una capa de texto invisible, obteniendo un PDF con búsqueda, o descargar solo el texto reconocido en un archivo .txt. El reconocimiento se hace en tu navegador con el motor libre Tesseract, así que el escaneo nunca sale de tu dispositivo.
Cómo hacer OCR a un PDF
- Añade un PDF escaneado o una imagen (PDF, JPG, PNG, WebP o BMP, hasta 100 MB). También puedes pegar una captura con Ctrl+V.
- Elige el idioma del documento; por defecto es el de esta página. Añade un segundo idioma si el documento es bilingüe.
- Elige la salida: PDF con búsqueda o Texto plano. En un PDF puedes limitar el OCR a ciertas páginas, por ejemplo 1-3, 7.
- Pulsa Reconocer texto. La primera vez se descargan los datos del idioma, que después quedan en caché. El progreso se muestra página a página.
- Descarga archivo-ocr.pdf o archivo.txt.
Idiomas disponibles
Inglés, francés, español, alemán, italiano, portugués, ruso, árabe, hindi, chino simplificado y tradicional, japonés, coreano, turco y urdu. Elegir bien el idioma es clave: indica al motor qué alfabeto y qué palabras esperar. Añade un segundo idioma solo si el documento lo contiene de verdad, porque cada idioma extra hace el proceso más lento.
Cómo queda el PDF con búsqueda
Tus páginas no se modifican ni se recomprimen. Cada página se renderiza hasta 300 DPI para el reconocimiento y las palabras reconocidas se colocan como capa invisible justo encima de las impresas. El documento se ve igual, pero Ctrl+F encuentra palabras, puedes resaltar y copiar, y los buscadores internos pueden indexar el archivo.
¿Qué precisión esperar?
- Mejores resultados: texto impreso nítido, escaneado a 300 DPI, páginas rectas y buen contraste.
- Resultados más flojos: fotos borrosas, letra muy pequeña, páginas torcidas, fondos de color y tipografías decorativas.
- No apto: escritura a mano, que Tesseract no lee de forma fiable.
- El árabe, el hindi y el chino suelen necesitar un escaneo más nítido que el alfabeto latino.
Revisa siempre cifras, nombres y fechas importantes.
Consejos y herramientas relacionadas
- ¿Fotografías documentos en papel? Escanear a PDF endereza y limpia las páginas antes del OCR.
- Para obtener texto estructurado, convierte después el PDF con búsqueda con PDF a Markdown.
- Si el PDF ya tiene texto seleccionable, el extractor de texto PDF es instantáneo y exacto.
Privado y gratis
El reconocimiento ocurre en tu ordenador o móvil, así que contratos, documentos de identidad o informes médicos nunca se envían a WoowPDF. Solo se descarga el modelo de idioma. Sin registro, sin límite diario y sin marca de agua. La velocidad depende de tu dispositivo: unos segundos por página en un portátil.
Funciones
- OCR en 15 idiomas, con segundo idioma opcional
- PDF con búsqueda y capa de texto invisible
- Exportación a texto plano (.txt) con marcas de página
- PDF escaneados e imágenes JPG, PNG, WebP y BMP
- Todas las páginas o un rango elegido
- En tu navegador: el archivo no se sube
Preguntas frecuentes
¿Qué es el OCR de PDF?
El reconocimiento óptico de caracteres lee el texto de páginas escaneadas o fotografiadas y lo convierte en caracteres reales que puedes buscar y copiar.
¿Se sube mi documento escaneado?
No. El reconocimiento se hace en tu navegador con Tesseract; solo se descargan una vez los datos del idioma.
¿Qué idiomas reconoce?
Inglés, francés, español, alemán, italiano, portugués, ruso, árabe, hindi, chino simplificado y tradicional, japonés, coreano, turco y urdu, combinables de dos en dos.
¿Qué diferencia hay entre PDF con búsqueda y texto plano?
El PDF con búsqueda conserva tus páginas y añade una capa de texto invisible. El texto plano solo entrega las palabras reconocidas en un .txt.
¿Reconoce letra manuscrita?
No de forma fiable: el motor está entrenado con texto impreso.
¿Cómo mejorar la precisión?
Usa un escaneo nítido de unos 300 DPI, páginas rectas y el idioma correcto, sin añadir idiomas innecesarios.