扫描件转成文字后,先校对哪几处再交给 AI?
一份扫描文件能打开,不代表里面的文字已经识别准确。先检查输入,比反复要求 AI “认真读”更有用。这里给的是文字校对清单,不是某款 OCR 的效果评测;扫描件识别能力也不能由对话模型的名字推断。
先保留原件和页码
用你有权使用的工具提取文字,同时保留原始图片或 PDF。选择一页作检查,把识别文字与图片并排看。不要把校对后文本覆盖原件;可以另存一份,标注页码、修订日期和未确定的位置。
客户信息、身份证号、联系方式等先脱敏。不要为演示上传整份敏感文件。若产品附件没有得到可读文本,换成已经人工校对的一小段文字也能继续整理,不必不断上传相同文件。
六项检查,不要只看句子通不通
| 检查项 | 重点看什么 | 出现疑点怎么记录 |
|---|---|---|
| 数字 | 小数点、百分号、0与字母O | 原件不清晰时写“待核”,不猜 |
| 否定词 | 不、未、不得、除外 | 连同前后句一起核对 |
| 日期 | 年月日是否缺位、有效期起止 | 保留原格式,不擅自补年份 |
| 名称 | 同音字、人名、型号后缀 | 使用原件确认,不能按常识改 |
| 换行 | 两栏是否串行、表头是否落到正文 | 先恢复阅读顺序再问问题 |
| 漏页 | 页码是否连续、附件是否遗漏 | 写明当前只有哪些页 |
这六项不能保证没有错误。它们是优先检查位置,重要结论仍需逐项回看原件。
一个否定词就能改变结论
虚构示例:原件写“本批次不包含安装服务”,识别文本却是“本批次包含安装服务”。后续总结越流畅,越容易把这个输入错误扩散成确定承诺。这里不是模型实测结果,只演示为什么要先检查否定词。
对照图片修正后,可这样提问:
下面是已人工校对的第2页文字,其他页尚未提供。
请提取服务包含项、明确排除项、待确认项。
每项附原文短引用,不推断其他页内容。
标有[待核]的部分不能作为确定结论。
[粘贴小段文字]
收尾时留下可追溯版本
核对 AI 的每个引用是否存在,确认排除项没有被移到包含项,未提供页没有被写成“无相关说明”。若仍有关键字符看不清,应回到清晰原件或找材料提供者确认,停止依据该处作结论。
打开不墨 AI 的 DeepSeek 页面,粘贴一段校对后的文字并生成包含项与排除项表。按页面提示登录,使用账户当前可用额度;本文不承诺扫描件必能解析、全文自动读取或免费次数。
一句话总结:先把原件里的事实校对清楚,再让 AI 帮你整理;流畅的输出不能修复错误的输入。
文件传上去读不了、或读了却答不对的通用排查步骤,见DeepSeek 上传文件读不了?PDF、Word、Excel 的排查步骤。