从任意 PDF 或图像中提取文本
支持 30 多种语言的 OCR。导出为可搜索的 PDF、Word DOCX、TXT 或 Markdown。完全在您的浏览器中运行 — 不会上传任何内容到服务器。
拖放或点击上传
扫描的 PDF、JPG、PNG、WebP 或 TIFF
每个 PDF 最多 100 页 · 支持多张图片
正在初始化…
您的文件已就绪
支持的语言
导出格式
- 可搜索的 PDF(推荐) — 保留原始布局;文本在任何 PDF 查看器中均可选择
- Word 文档(.docx) — 在 Microsoft Word 或 Google 文档中打开并编辑
- 纯文本(.txt) — 干净的文本输出,UTF-8 编码
- Markdown(.md) — 按段落分组的结构化文本
100% 私密
所有 OCR 处理均使用 WebAssembly 在您的浏览器内运行。您的文件永远不会发送到任何服务器 — 甚至不会发送到我们的服务器。处理过程与在自己屏幕上阅读文档一样私密。
为什么使用 PDFlexa AI OCR?
Tesseract LSTM 引擎
由 Tesseract 的 LSTM 神经网络驱动 — 开源 OCR 的行业标准,在干净文档上的单词准确率达 95–99%。
保留布局
可搜索 PDF 导出功能保持原始页面图像完好,并添加一个不可见的文本层 — 保留每一处边距、栏目和视觉元素。
后台处理
专用的 Web Worker 在后台线程中运行 OCR — 在处理大型多页文档时,您的浏览器标签页仍保持完全可交互。
支持 33 种语言
从阿拉伯语、中文到乌克兰语、泰语 — 几乎涵盖世界上所有主要语言,包括从右到左书写的文字。
4 种导出格式
可搜索 PDF、Word DOCX、纯文本 TXT 和 Markdown — 无需转换步骤,直接导出为适合您工作流程的格式。
零数据留存
由于处理过程从不离开您的浏览器,因此没有需要保留或删除的文件。您的文档与自己书桌上的文件一样私密。
如何从扫描的 PDF 中提取文字
上传您的扫描 PDF 或图像
将扫描的 PDF、JPG、PNG、WebP 或 TIFF 拖放到上传区域,或点击“选择文件”进行浏览。支持多页 PDF 和多个图像文件。
选择语言和输出格式
从 33 种可用选项中选择文档所使用的语言。然后选择您偏好的导出格式 — 建议使用可搜索 PDF 以获得最大兼容性。
点击“开始 OCR”并下载
OCR 引擎会在后台工作进程中处理您的文档。进度条会显示当前正在处理的页面。完成后,即可立即下载结果。
关于 OCR 的常见问题
什么是 OCR,它是如何工作的?
OCR(光学字符识别)将文本图像——扫描文档、打印页面的照片或纯图像 PDF——转换为机器可读的字符。该引擎分析像素模式,并将其映射为字母、数字和标点符号。Pdflexa 使用 Tesseract,这是世界上最准确的开源 OCR 引擎,完全在您的浏览器中运行。
OCR 工具接受哪些文件格式?
您可以上传扫描的 PDF 文件以及 JPEG/JPG、PNG、WebP 和 TIFF 图像。多页 PDF 会逐页处理(每个文件最多 100 页)。批量上传功能可让您一次性对多个图像进行 OCR。
OCR 引擎支持多少种语言?
OCR 引擎支持 33 种语言,包括中文、英语、西班牙语、法语、德语(简体和繁体中文)、日语、韩语、阿拉伯语、俄语、印地语等。为最大限度提高准确率,请在处理前选择正确的文档语言。
我的文档会上传到 Pdflexa 的服务器吗?
不会。每一步——PDF 渲染、OCR 识别和输出生成——都使用 WebAssembly 和 JavaScript 完全在您的浏览器内运行。您的文件永远不会离开您的设备,这使其成为在线可用的最私密的 OCR 工具。
我可以导出哪些输出格式?
您可以将识别的文本导出为可搜索 PDF(原始图像附带不可见文本层,使其在任何 PDF 查看器中都可选择和复制)、纯文本 TXT、Microsoft Word DOCX 或 Markdown。所有格式都保留文本的逻辑阅读顺序。
文本识别的准确率如何?
准确率取决于文档质量、分辨率和语言。在支持的语言中,300 DPI 或以上的清晰高分辨率扫描件通常在 Tesseract 的 LSTM 引擎下可达到超过 98% 的单词准确率。手写文字、装饰性字体、低对比度文档或混合语言页面的准确率会较低。
我可以对页数很多的大型 PDF 进行 OCR 吗?
可以。OCR 引擎使用后台 Web Worker 按顺序处理页面,因此您的浏览器界面始终保持响应。每个文件最多支持 100 页。对于非常大的文档,处理可能需要几分钟——实时进度指示器会显示当前正在处理的页面。
OCR 会保留原始文档布局吗?
由于页面图像保持完整,文本以不可见叠加层的形式写入,可搜索 PDF 导出能完美保留原始视觉布局。对于 TXT、DOCX 和 Markdown 导出,文本按阅读顺序提取,但视觉格式(栏目、表格)为近似还原,而非精确复现。