从扫描件和照片中提取文字
扫描件本质上是一张文字的图片,因此无法复制、搜索和选中。OCR 会把其中的字符重新识别出来。你既可以得到纯文本,也可以得到同一份文档加上一层隐藏文字层,让它像普通 PDF 一样使用。
- 支持扫描版 PDF 和照片,最多 200 页
- 支持七种语言,包括俄语、日语和中文
- 可搜索 PDF 完全保持页面原有外观
- 文件自动删除 —— 免费版保留 24 小时,付费方案保留 7 天
支持 PDF、PNG、JPG、TIFF、BMP、GIF、WebP 或 HEIC。
请选择页面上实际使用的语言。选错不会报错 —— 只会返回一堆乱七八糟的内容。
如何从扫描件中提取文字
- 01
上传扫描件或照片
选择一份扫描版 PDF 或页面图片。多页 PDF 会按顺序逐页识别。
- 02
选择语言
选择文档实际使用的语言。这比听上去更重要:语言选错不会报错,而是会输出看似正确、实则毫无意义的内容。
- 03
选择纯文本或可搜索 PDF
纯文本给你可直接复制的字符。可搜索 PDF 返回原始页面并附带隐藏文字层,文件外观保持不变,但可以搜索和选中。
- 04
查看或下载结果
文字会直接显示在页面上供你复制;可搜索 PDF 则会立即下载。
哪些因素会影响准确率
分辨率。页面在识别前会以 300 DPI 渲染,这也是 Tesseract 官方文档推荐的水平。距离过远拍摄的照片,或以 100 DPI 扫描的文件,可供识别引擎处理的信息就更少。
端正程度与对焦。倾斜拍摄的页面,或书脊附近文字弯曲的页面,识别效果明显不如平整的扫描件。
语言。每种语言都有各自训练出的模型。用英语模型去识别西里尔字母或日文,得到的不是报错,而是一堆读起来很流畅的垃圾内容 —— 因此选择器只提供服务器确实能够加载的语言。
OCR 做不到什么。版面不会被保留:分栏、表格和页眉都会按阅读顺序还原成连续文本。如果原始 PDF 本身已有文字层,把它转换为文本时会直接使用该文字层 —— 精确、即时,效果优于任何 OCR。
人们通常用它来做什么
合同与发票
以扫描件形式收到的已签署 PDF,转成可搜索文件,方便日后查找单据编号。
用手机拍下的收据
直接从照片中提取金额和日期,不必再手动重新录入。
旧文档与档案
多年前扫描的纸质记录,在不改变页面外观的前提下变得可搜索。
截图与幻灯片
在原始文件早已丢失的情况下,从图片中找回文字内容。
常见问题
什么是可搜索 PDF?
一个可搜索 PDF 看起来和你上传的扫描件完全一样,只是在文字位置上叠加了一层隐藏的识别文本。页面视觉上没有任何变化,但你现在可以选中、复制和搜索其中的文字,其他软件也可以。
支持哪些语言?
英语、俄语、法语、德语、西班牙语、日语和简体中文。选择器列出的正是服务器能够加载的语言 —— 绝不会提供某种会悄无声息输出乱码的语言。
最多能处理多少页?
每个文件最多 200 页。每一页都会单独渲染和识别,因此文档越长,耗时也按比例增加。
OCR 的准确率值得信赖吗?
对于清晰、端正的印刷体扫描件,准确率非常高。手写体、低分辨率照片、倾斜页面和特殊字体的效果都会差不少。重要数字务必核对 —— OCR 出错时看起来像是合理的文字,而不像是错误。
你们会保存我的文档吗?
保存时间不会超过你所在方案的保留期限:免费版和未注册访客为 24 小时,付费方案为 7 天。文件通过 TLS 传输,除了生成你的结果之外不作任何其他用途。
我的 PDF 已经可以选中文字,还需要 OCR 吗?
不需要。如果 PDF 本身已有文字层,转换为文本时会直接使用该文字层,既精确又即时。只有在没有可提取内容时 —— 也就是页面确实只是一张图片时 —— 才会启用 OCR。