OCR 读错的往往不是整句话,而是一个关键字段
一份扫描合同大部分文字都识别正确,系统因此顺利提取了客户名称、金额和日期。真正入账后才发现,金额里的小数点丢了,合同编号中的字母被识别成数字,生效日期也因为印章遮挡少了一位。整体文本看起来很像原文,错误却刚好落在最影响业务的地方。
企业常把 OCR 成功理解为“生成了一段文字”。但文档自动化最终要使用字段,不同字段的重要程度不一样。公司名称、金额、税号、日期、账号和合同期限,不能和普通说明文字采用同一条通过标准。
先做文档入口检查,再让模型理解内容
上传时可以检查图片分辨率、倾斜、遮挡、页序、重复页和文件完整性。低于要求的文档先提示重新拍摄或人工处理,不要让系统带着明显缺陷继续往下跑。对于多页合同,还要确认页码和附件没有被拆散,否则内容关系会在后续检索中丢失。
OCR 输出后,为关键字段保留置信度和原图位置。员工不需要逐字核对整份文档,只要优先检查低置信字段和高风险字段,就能把有限的人工时间用在最容易出错的地方。原图、识别结果和最终修正值也要保持关联。
- 按金额、日期、账号和主体名称设置更严格的质量门槛。
- 保存字段所在页码和区域,方便人工快速回看原图。
- 识别失败、版面异常和多份文件冲突时转人工,不静默放行。
置信度只是提醒,不是业务正确性的证明
识别模型可能对一串字符很有把握,但无法知道这串字符是否符合企业业务。比如金额格式正确,却高于合同总额;日期格式正确,却早于签署日期。系统需要把 OCR 结果和业务规则结合起来,检查字段之间的关系,而不是看到置信度高就直接写入。
人工抽检也不能只抽取“看起来最差”的文档。还要定期抽样高置信结果,了解系统有没有稳定地错某一类字体、印章、表格或拍摄角度。抽检发现的问题要回到文档要求、识别配置或下游校验中解决。
错误处理要让员工知道该改哪里
系统提示“识别失败”对员工帮助不大。更好的结果是标出具体字段、原图位置和可能原因,例如图片模糊、字段被遮挡、两页内容冲突或格式不符合要求。员工修正后,系统应记录是改了哪一项、原始值是什么,并在必要时要求复核。
涉及发票入账、合同审批、客户开户和付款信息时,修正动作要有责任人。不能让员工直接覆盖原始识别结果后没有痕迹。保留原图和版本,不是为了制造手续,而是为了在业务发生争议时知道数据从哪里来、谁确认过。
验收要覆盖真实纸张、真实光线和真实例外
测试样本应包含手机拍摄、传真件、复印件、手写补充、盖章遮挡、表格跨页和旧模板,不要只用清晰电子 PDF。检查每类关键字段的识别率、人工修正时间和漏检风险,并观察员工是否能快速定位需要复核的位置。
企业 AI 文档处理的第一步不是追求完全无人参与,而是让系统把容易的部分处理好,把高风险和看不清的部分及时交给人。入口质量守住了,后面的分类、审批和写回才有继续自动化的基础。
要点总结
- 不可以直接这样判断。关键字段还要经过业务规则校验和必要的人工抽检。
- 金额、日期、账号、税号、合同编号、主体名称和会触发业务动作的字段应优先复核。
- 可以按字段和风险处理,低风险文字可继续使用,高风险字段进入人工确认。
参考来源说明
本文围绕“扫描件交给 AI 前先看清楚:OCR 错一个数字,后面流程全会偏”展开,结合 5 份公开资料及一路凯歌在“企业 AI 服务”方向的执行经验整理,重点看它对官网可引用结构、FAQ 设计和后续获客复盘的影响。
