PDF OCR——从扫描的页面中提取文字

将扫描和纯图像 PDF 变成可搜索、可选择的文字。识别 10 种语言,将文字提取到 .txt 文件,或创建带有不可见文字层的可搜索 PDF。一切都在您的浏览器中运行。

主要功能

10 种以上语言

识别英语、简体中文、繁体中文、日语、韩语、西班牙语、法语、德语、葡萄牙语和阿拉伯语——或同时组合多种语言。

可搜索 PDF

创建带有不可见文字层的 PDF,使扫描的页面在任何阅读器中都可搜索、可选择。

文字提取

将识别的文字提取到纯 .txt 文件,带有页面分隔符,可直接编辑或复制。

完全控制

选择输出格式、OCR 质量和特定的页面范围——无需处理整个文档。

100% 私密

所有处理都在您的浏览器中本地完成。您的文件绝不会上传到任何服务器。

免费无需安装

任何装有浏览器的设备都能使用。无需注册、无水印,完全免费。

什么是 PDF OCR?

OCR(光学字符识别)将文字图像转换为机器可读的文字。扫描的 PDF 实际上是页面的图片——其中的单词无法搜索、复制或选择。此工具渲染每一页并用神经网络 OCR 引擎识别文字,然后让您导出识别的文字或将其作为不可见文字层写回 PDF。结果是您可以搜索单词、选择和复制句子以及自动索引内容的文档。所有处理都在您的浏览器中本地完成,因此您的文档绝不会离开您的设备。

如何对 PDF 进行 OCR

运行 OCR 只需几个步骤。一切都在您的浏览器中完成。

1

上传扫描的 PDF

拖放扫描或纯图像的 PDF,或点击上传区域选择它。

2

选择您的选项

选择语言、输出格式(文字或可搜索 PDF)、质量和可选的页面范围。默认值对大多数文档都适用。

3

开始 OCR

点击“开始 OCR”。每个选定的页面都会被自动渲染和识别。

4

下载结果

下载提取的 .txt 文件或可搜索 PDF。对于文字输出,预览会显示识别出的内容。

需要了解

为了获得最佳效果,请使用清晰、高分辨率的扫描件并选择正确的语言。非常小、模糊或高度风格化的文字可能识别准确率较低。受密码保护的 PDF 必须先解锁才能进行 OCR。首次 OCR 运行会加载识别引擎和语言数据,可能需要几秒钟;后续运行更快。更高质量设置会提高准确率但会减慢处理速度。阿拉伯语和一些文字系统在单独选择其语言时识别效果最佳。

常见问题解答