PDF OCR 在线文字识别
用 OCR 让扫描版 PDF 和照片可搜索,支持 15 种语言。输出可搜索 PDF 或纯文本,全程在浏览器中识别,无需上传。
如何在线对扫描版 PDF 进行 OCR
扫描件本质上只是页面的图片:无法搜索、无法选中句子,也无法复制其中的数字。PDF OCR(光学字符识别)会读取图片中的文字,把它们变成真正的文本。您可以保留原始外观并添加一层不可见的文字层,得到可搜索的 PDF;也可以只把识别出的文字下载为 .txt 文件。识别过程使用开源的 Tesseract 引擎在您的浏览器中完成,扫描件不会离开您的设备。
如何对 PDF 进行 OCR
- 添加扫描版 PDF 或图片(支持 PDF、JPG、PNG、WebP、BMP,最大 100 MB),也可以用 Ctrl+V 直接粘贴截图。
- 选择文档语言,默认与当前页面语言一致。如果文档包含两种语言(例如中英混排),可以再添加第二语言。
- 选择输出方式:可搜索 PDF 或纯文本。对于 PDF,还可以只识别指定页面,例如 1-3, 7。
- 点击“识别文字”。首次使用时会下载语言数据,之后会缓存供下次使用。识别进度按页显示。
- 下载结果:文件名-ocr.pdf 或 文件名.txt。
支持的语言
英语、法语、西班牙语、德语、意大利语、葡萄牙语、俄语、阿拉伯语、印地语、简体中文、繁体中文、日语、韩语、土耳其语和乌尔都语。选对语言非常重要,它告诉引擎应该识别哪种文字和哪些词汇,选错会得到乱码。只有文档确实包含两种语言时才添加第二语言,因为每多一种语言,识别速度都会变慢。
可搜索 PDF 是什么样的
您的页面不会被修改或重新压缩。每页会以最高 300 DPI 渲染用于识别,然后把识别出的文字作为不可见层精确地叠放在原有文字上。文档外观与之前完全相同,但可以用 Ctrl+F 搜索、选中并复制文字,文档管理系统也能为其建立索引。纯文本输出会在每页内容前加上页码标记,便于粘贴到邮件或表格中。
识别准确率如何?
- 效果最好:以 300 DPI 扫描的清晰印刷文字,页面端正,对比度高。这种情况下 Tesseract 几乎能识别出每个字。
- 效果较差:模糊的手机照片、字号很小、页面倾斜或弯曲、彩色背景以及艺术字体。条件允许时请重新扫描或裁剪。
- 不适用:手写文字。Tesseract 针对印刷体训练,无法可靠识别手写笔记。
- 中文、阿拉伯文、印地文等复杂文字通常需要比拉丁字母更清晰的扫描件才能达到同样的准确率。
和所有 OCR 一样,重要的数字、姓名和日期请务必人工核对。
技巧与相关工具
- 用手机拍摄纸质文件?扫描转 PDF 可在 OCR 之前拉直并清理页面。
- 需要带结构的文本而不是纯 .txt?先做 OCR,再用 PDF 转 Markdown 转换可搜索 PDF。
- 如果 PDF 本身已有可选中的文字,就不需要 OCR,PDF 文本提取 更快也更准确。
私密且免费
识别在您自己的电脑或手机上进行,合同、证件、病历等机密扫描件绝不会上传到 WoowPDF,只会下载语言模型。无需注册,没有每日页数限制,也没有水印。速度取决于设备性能:笔记本电脑上每页约几秒钟,较旧的手机会慢一些。
功能
- 支持 15 种语言,可选第二语言
- 生成带不可见文字层的可搜索 PDF
- 导出纯文本 (.txt),附页码标记
- 支持扫描 PDF 及 JPG、PNG、WebP、BMP 图片
- 识别全部页面或指定页码范围
- 在浏览器中处理,文件不上传
常见问题
什么是 PDF OCR?
OCR(光学字符识别)读取扫描或拍摄页面中的文字,并将其转换为可搜索、可复制的真实字符。
我的扫描件会被上传吗?
不会。识别使用 Tesseract 在浏览器中完成,只需一次性下载语言数据,文件始终留在您的设备上。
支持哪些语言?
英语、法语、西班牙语、德语、意大利语、葡萄牙语、俄语、阿拉伯语、印地语、简体和繁体中文、日语、韩语、土耳其语和乌尔都语,并可同时选择两种语言。
可搜索 PDF 和纯文本有什么区别?
可搜索 PDF 保留原始页面,并在上方添加不可见的文字层;纯文本只把识别出的文字保存为 .txt 文件。
能识别手写文字吗?
不能可靠识别。引擎针对印刷体训练,手写内容的效果通常很差。
如何提高识别准确率?
使用约 300 DPI 的清晰扫描件,保持页面端正,选择正确的文档语言,不要添加不需要的第二语言。