将扫描和纯图像 PDF 变成可搜索、可选择的文字。识别 10 种语言,将文字提取到 .txt 文件,或创建带有不可见文字层的可搜索 PDF。一切都在您的浏览器中运行。
识别英语、简体中文、繁体中文、日语、韩语、西班牙语、法语、德语、葡萄牙语和阿拉伯语——或同时组合多种语言。
创建带有不可见文字层的 PDF,使扫描的页面在任何阅读器中都可搜索、可选择。
将识别的文字提取到纯 .txt 文件,带有页面分隔符,可直接编辑或复制。
选择输出格式、OCR 质量和特定的页面范围——无需处理整个文档。
所有处理都在您的浏览器中本地完成。您的文件绝不会上传到任何服务器。
任何装有浏览器的设备都能使用。无需注册、无水印,完全免费。
OCR(光学字符识别)将文字图像转换为机器可读的文字。扫描的 PDF 实际上是页面的图片——其中的单词无法搜索、复制或选择。此工具渲染每一页并用神经网络 OCR 引擎识别文字,然后让您导出识别的文字或将其作为不可见文字层写回 PDF。结果是您可以搜索单词、选择和复制句子以及自动索引内容的文档。所有处理都在您的浏览器中本地完成,因此您的文档绝不会离开您的设备。
运行 OCR 只需几个步骤。一切都在您的浏览器中完成。
拖放扫描或纯图像的 PDF,或点击上传区域选择它。
选择语言、输出格式(文字或可搜索 PDF)、质量和可选的页面范围。默认值对大多数文档都适用。
点击“开始 OCR”。每个选定的页面都会被自动渲染和识别。
下载提取的 .txt 文件或可搜索 PDF。对于文字输出,预览会显示识别出的内容。
为了获得最佳效果,请使用清晰、高分辨率的扫描件并选择正确的语言。非常小、模糊或高度风格化的文字可能识别准确率较低。受密码保护的 PDF 必须先解锁才能进行 OCR。首次 OCR 运行会加载识别引擎和语言数据,可能需要几秒钟;后续运行更快。更高质量设置会提高准确率但会减慢处理速度。阿拉伯语和一些文字系统在单独选择其语言时识别效果最佳。