← 返回博客

扫描件转成文字后,先校对哪几处再交给 AI?

2026-10-06 · 3 分钟阅读
文件处理操作清单不墨AI

一份扫描文件能打开,不代表里面的文字已经识别准确。先检查输入,比反复要求 AI “认真读”更有用。这里给的是文字校对清单,不是某款 OCR 的效果评测;扫描件识别能力也不能由对话模型的名字推断。

先保留原件和页码

用你有权使用的工具提取文字,同时保留原始图片或 PDF。选择一页作检查,把识别文字与图片并排看。不要把校对后文本覆盖原件;可以另存一份,标注页码、修订日期和未确定的位置。

客户信息、身份证号、联系方式等先脱敏。不要为演示上传整份敏感文件。若产品附件没有得到可读文本,换成已经人工校对的一小段文字也能继续整理,不必不断上传相同文件。

六项检查,不要只看句子通不通

检查项重点看什么出现疑点怎么记录
数字小数点、百分号、0与字母O原件不清晰时写“待核”,不猜
否定词不、未、不得、除外连同前后句一起核对
日期年月日是否缺位、有效期起止保留原格式,不擅自补年份
名称同音字、人名、型号后缀使用原件确认,不能按常识改
换行两栏是否串行、表头是否落到正文先恢复阅读顺序再问问题
漏页页码是否连续、附件是否遗漏写明当前只有哪些页

这六项不能保证没有错误。它们是优先检查位置,重要结论仍需逐项回看原件。

一个否定词就能改变结论

虚构示例:原件写“本批次不包含安装服务”,识别文本却是“本批次包含安装服务”。后续总结越流畅,越容易把这个输入错误扩散成确定承诺。这里不是模型实测结果,只演示为什么要先检查否定词。

对照图片修正后,可这样提问:

下面是已人工校对的第2页文字,其他页尚未提供。
请提取服务包含项、明确排除项、待确认项。
每项附原文短引用,不推断其他页内容。
标有[待核]的部分不能作为确定结论。
[粘贴小段文字]

收尾时留下可追溯版本

核对 AI 的每个引用是否存在,确认排除项没有被移到包含项,未提供页没有被写成“无相关说明”。若仍有关键字符看不清,应回到清晰原件或找材料提供者确认,停止依据该处作结论。

打开不墨 AI 的 DeepSeek 页面,粘贴一段校对后的文字并生成包含项与排除项表。按页面提示登录,使用账户当前可用额度;本文不承诺扫描件必能解析、全文自动读取或免费次数。

一句话总结:先把原件里的事实校对清楚,再让 AI 帮你整理;流畅的输出不能修复错误的输入。

文件传上去读不了、或读了却答不对的通用排查步骤,见DeepSeek 上传文件读不了?PDF、Word、Excel 的排查步骤。