扫描件合同的文字提取
扫描出来的合同,看着和普通 PDF 没区别,但里面的文字选不中、搜不到、复制不出来。这是因为它本质上是照片,不是文字。
为什么扫描件复制不出文字
扫描仪和手机拍照一样,记录的是「这一页长什么样」——像素的颜色分布。它不知道哪些像素组成了「甲」字,更不知道那是个字。所以你能看到内容,但软件不能。
文字识别做的就是补上这一步:分析图像,判断出哪里是文字、是什么字,再输出成真正的文本。
决定识别率的三个因素
第一是清晰度。这是影响最大的因素——模糊、重影、分辨率过低的扫描件,识别率会断崖式下跌。如果原件还能重新扫,用更高的分辨率重扫一遍,比换任何工具都有效。
第二是倾斜角度。扫描时纸张放歪了几度,人眼几乎察觉不到,但识别引擎是按水平行来切分文字的,倾斜会让它切错行。大多数扫描仪自带纠偏,手机扫描类 App 也通常会自动校正。
第三是版式复杂度。单栏、字距正常的正文识别率最高;多栏排版、表格、竖排文字、艺术字体会明显更差。
识别之后一定要校对
即使是清晰的印刷体,识别也难免出错,而且出错的地方往往很微妙——「己」和「已」、「未」和「末」,这类字形相近的字错了不容易一眼看出来。
如果识别结果要用于正式场合(合同条款、金额、姓名、日期),务必逐字核对关键部分。数字和小数点尤其要盯紧。
手写内容基本识别不了
需要提前说明的是:手写签名、手写批注这类内容,目前的识别效果远不如印刷体,通常只能识别出个大概,不适合依赖。
如果一份文件里既有印刷体又有手写内容,识别结果里手写部分基本可以忽略,重点看印刷体部分。
常见问题
识别会保留原来的排版吗?+
不会,输出的是纯文本。表格、分栏这类版式在识别过程里会丢失。
中文和英文能一起识别吗?+
可以,中英文混排的文档通常没问题。