什么是图片文字识别?

使用完全在本地运行的 Tesseract OCR 引擎,从图片、截图、扫描文档和照片中提取文字。支持多种语言,输出可编辑文本供您复制或下载。文件不会离开您的设备,所有处理均在本地完成。

本工具内置编译为 WebAssembly 的 Tesseract OCR,并附带 20 个训练好的语言包(英语、西班牙语、法语、德语、意大利语、荷兰语、葡萄牙语、波兰语、瑞典语、土耳其语、俄语、阿拉伯语、印地语、泰语、越南语、简体/繁体中文、日语、韩语、印尼语)。每个语言包在首次使用时下载一次,之后会被缓存。你可以载入图片或单页 PDF,旋转倾斜的照片,并在识别前框选某个区域,然后将结果保存为纯文本或 Word 文档。在截图、300 dpi 扫描件和清晰的小票上准确率较高,印刷体可达 95% 以上,手写或倾斜照片则会下降。

使用方法

  1. 上传包含待提取文字的图片(PNG、JPG、BMP 或 WebP)或单页 PDF,或从剪贴板粘贴截图。第一次使用?点击「试用示例」即可在示例上看到效果。
  2. 选择图片中文字的语言以提高识别准确率,然后点击“提取文字”开始 OCR 处理。
  3. 检查识别出的文字,更正错误,然后复制,或下载为 .txt 或 Word(.docx)文件。

何时使用

  • 从聊天截图、幻灯片截图或禁止复制的 PDF 截图里抠出文字。
  • 把纸质收据照片里的明细一条条录进记账表格。
  • 把手写或印刷的课堂笔记数字化,以后可以全文搜索。

结果

上传一张餐厅小票的照片:OCR 会逐行读出内容,比如“凯撒沙拉——¥78”和“气泡水——¥25”,并给你一段干净的文本,可以直接粘贴到电子表格里。

常见问题

OCR 引擎能识别哪些语言?
支持英语、西班牙语、法语、德语、意大利语、荷兰语、葡萄牙语、波兰语、瑞典语、土耳其语、俄语、阿拉伯语、印地语、泰语、越南语、简繁中文、日语、韩语、印尼语,共 20 种。选最接近图片内容的那个。多语言混排时,选占主导地位的那种文字系统效果最好。
识别准确率大概有多高?
300 dpi 以上的清晰印刷文字(截图、扫描 PDF),准确率通常在 95% 以上。手写、对比度低、有运动模糊或斜拍的照片会大幅拉低准确率。结果旁的「置信度」分数能告诉你 Tesseract 对识别有多确定。
为什么第一次切换语言要等几秒钟?
每个 Tesseract 语言模型约 10 到 20 MB,首次选用时需要下载。之后会被浏览器缓存,同一语言再次识别几乎是即时完成,不会再耗时下载。
可以直接从剪贴板粘贴截图,不上传文件吗?
可以。先用 Win+Shift+S(Windows)或 Cmd+Ctrl+Shift+4(macOS)截图,然后点「粘贴图片」。工具会直接从剪贴板读取图像,不需要先保存到硬盘。
我的图片会被上传到服务器吗?
不会。Tesseract 通过 WebAssembly 在页面里运行,图片字节不会离开你的设备。可以打开开发者工具断开网络,识别仍然能完成,这就是最好的证明。

相关工具