把文件交给国产 AI 之前,先过这 10 条检查:哪些能直接传、哪些脱敏后再传、哪些无论如何不要传(附 3 分钟脱敏做法)
先说一件事:我不打算在这篇里吓唬你。「AI 会偷你的数据」这类说法我们在流传最广的 14 个说法核查里已经拆过,多数是夸大的。但反过来「什么都能传」也不对——不是因为模型会做坏事,而是你传上去的东西会经过网络、存在服务器、可能被人工抽查、可能出现在你的对话历史里被别人看到。这四件事跟模型好不好没关系,跟任何在线服务都一样。
所以问题不是「AI 安不安全」,而是「这份文件里有什么,是我不希望离开自己电脑的」。把这个问题拆细,就是下面 10 条。
先交代立场:我们做的不墨 AI 助手是一个把 DeepSeek、Kimi K3、通义千问、GLM-5.1 放在一起的聚合平台,用户上传的文件我们同样要经手,所以这篇的每一条也是我们自己给用户的建议,不是站在「你尽管传」的立场写的。
三个结论是什么意思
每条检查给的结论只有三种,先把定义说清楚:
- ✅ 能直接传:文件里没有能定位到具体个人或具体公司的信息,或者信息本来就是公开的。传了最坏的结果是「被别人看到也无所谓」。
- 🟡 脱敏后传:文件本身很有用、AI 也确实能帮上忙,但里面夹着不该出去的字段。把那几个字段替换掉再传,AI 的分析结果基本不变。这一档是绝大多数文件的归宿。
- ⛔ 不要传:脱敏之后文件就没意义了,或者法律/合同明确禁止外传,或者泄露的后果你承担不起。这类换个做法:只传结构、只口头描述、或者干脆自己做。
10 条检查
1. 里面有没有身份证号、手机号、银行卡号、家庭住址?
结论:🟡 脱敏后传。
这是最常见也最好处理的一类。简历、合同、体检报告、快递单、租房合同,几乎都有。但这些字段对 AI 的分析没有任何用处——它审合同不需要知道你的身份证号,看体检报告不需要你的手机号。
做法:传之前把这些替换成「张三」「138****0000」「XX 路 XX 号」。Word 里 Ctrl+H 全部替换,30 秒。图片类(比如身份证照片)直接不传,你需要 AI 帮忙的从来不是照片本身。
2. 有没有公司名、客户名、项目代号、内部产品名?
结论:🟡 脱敏后传(多数情况);⛔ 不要传(签了保密协议的)。
周报、方案、会议纪要、标书里全是这些。判断标准很简单:这份文件如果被竞争对手看到,会不会出问题? 会的话就替换成「A 公司」「客户 B」「项目 X」。
要注意的是替换要一致——同一个客户在全文里都叫「客户 B」,否则 AI 会把它当成两个客户,分析就错了。做法见后面「3 分钟脱敏」。
签了保密协议(NDA)的项目文件、标书正文、未公开的财务数据,直接归 ⛔。不是因为脱敏做不到,而是你不该赌「替换得够不够干净」。写标书那篇里我们给的做法是只传招标文件里的公开要求、让 AI 出框架,正文自己填。
3. 是不是别人的东西?
结论:⛔ 不要传。
这条最容易被忽略。同事的简历、客户发来的合同、朋友的病历、群里转发的内部文件——信息不是你的,你就没有权利决定它去哪。哪怕对方不会知道。
例外是对方明确让你帮忙处理的(「你帮我看看这份合同」),那你可以传,但按第 1、2 条先脱敏。
4. 有没有账号密码、API key、内部链接、服务器地址?
结论:⛔ 不要传,一个字符都不要。
程序员最容易踩这条:把配置文件、.env、带 token 的 curl 命令整段贴进去让 AI 排错。程序员那篇里说过,贴之前把密钥换成 xxx,AI 排错根本不需要真实的 key。
非程序员的版本:公司系统的登录信息、内部 wiki 链接、VPN 地址,同理。
5. 是不是医疗、法律、财务这类敏感类别?
结论:🟡 脱敏后传(个人的);⛔ 不要传(涉及他人或机构的)。
自己的体检报告、化验单、诊断书:去掉姓名、身份证号、医院名、医生名之后,剩下的指标数据可以传,AI 确实能帮你看懂体检报告。
自己的劳动合同、租房合同:去掉双方名称和证件号,条款全文可以传,审合同靠的是条款本身。
自己的工资单、个税、家庭账本:去掉姓名和账号,数字可以传。
但如果这些文件是公司的财务报表、客户的病历、当事人的案卷——归 ⛔。你是经手人不是所有者,参考第 3 条。
6. 这份文件是不是「唯一的一份」?
结论:✅ 能传,但先备份。
这条不是隐私问题,是操作风险。有人把唯一一份稿子传上去让 AI 改,改完直接复制回来覆盖原文——AI 改坏了一段,原稿也没了。
做法:先复制一份再传,AI 改完的版本另存,对照着用。改稿这件事改写润色横评里说过,几家的改法差别不小,你需要原稿做对照。
7. 文件里有没有「你不希望留下记录」的内容?
结论:⛔ 不要传,或传完删对话。
比如:跳槽前写的辞职信草稿、跟领导的矛盾复盘、还没公开的个人决定。这些内容本身不涉及第三方,但你不希望它出现在任何地方的历史记录里。
多数平台都能删除对话记录,删完了通常就不在你的账号下可见了,但服务端是否立刻物理删除各家政策不同。稳妥的做法是:这类内容只口头描述、不传文件,问完立刻删对话。
8. 传的是文字,还是图片/录音?
结论:文字 ✅ / 图片和录音 🟡。
图片和录音比文字更难脱敏——一张会议白板照片里可能有你没注意到的项目名;一段录音里有同事的声音、有你没听清的背景对话。
做法:能转成文字的先转成文字再传。会议录音先用转写工具出文字稿,删掉无关的段落,再让 AI 整理纪要。照片类先看一遍角落里有什么。
9. 用的是公司电脑、公司账号还是公司网络?
结论:先看公司规定,没规定就按 ⛔ 的标准处理公司文件。
越来越多的公司有明确的 AI 使用规定,有的禁止传任何内部文件,有的指定了可以用的平台。规定比这篇文章里的任何一条都优先。
没规定的,一个保守的原则:公司的文件默认按 ⛔ 处理,除非它本来就是对外公开的(官网内容、已发布的宣传材料、公开招标文件)。个人的文件按第 1~8 条走。
10. 传完之后,这份文件在平台上还留着吗?
结论:传完看一眼历史记录,不需要的删掉。
这是很多人忽略的收尾动作。你为了让 AI 审合同传了文件,审完了,这份合同就一直挂在你的对话历史里。三个月后你在别人面前打开 AI,翻历史的时候它就在那儿。
做法:用完即删,尤其是 🟡 类文件。传之前脱敏、传之后删除,两步都做到,剩下的风险已经很小了。
3 分钟脱敏:一个真能坚持下来的做法
上面 🟡 这一档是最多的,但如果脱敏要花 20 分钟,没人会坚持。下面这个做法是我们自己在用的,一份两三页的文件 3 分钟以内:
第一步(1 分钟):列出要替换的词。 打开文件,把「人名、公司名、证件号、手机号、地址、项目名」这六类扫一遍,列在便签上。通常 5~10 个。
第二步(1 分钟):全文替换。 Word / WPS 里 Ctrl+H,逐个替换成「张三」「A 公司」「客户 B」「138****0000」这种一看就是占位符的写法。同一个词全文用同一个替换,这样 AI 的理解不受影响。
第三步(1 分钟):通读一遍。 主要看有没有漏掉的变体——「王总」和「王经理」是同一个人,「XX 科技」和「XX 公司」是同一家。
替换完的文件,AI 的分析质量跟原文几乎没差别。我们拿28 页劳动合同那次横评的文件做过一次对照:脱敏前后 4 个模型指出的风险条款完全一样,因为风险在条款里,不在名字里。
一个小技巧:脱敏之后的文件另存为「xxx-脱敏版」,下次要问同一份文件直接用它,不用再做一遍。
反过来说:哪些是过度担心
写完 10 条 ⛔ 和 🟡,也要说说哪些是不用担心的,否则你会退回到「什么都不敢传」:
- 公开的东西不用脱敏:新闻、论文、公开的政策文件、产品说明书、官网内容。传就是了。
- 自己写的、不涉及别人的文字不用脱敏:读书笔记、日记里非私密的部分、自己的小说草稿。
- 纯数据不用过度处理:一份去掉了姓名列的销售数据表,剩下的数字对外人没有意义,可以直接让 AI 分析。
- 「AI 会学走我的内容」:主流平台对个人用户的对话内容用不用于训练有各自的政策说明,多数提供关闭选项。这件事比你想的可控,但它不能替代前面的脱敏——训练是一回事,传输和存储是另一回事。
一页速查
| 文件里有什么 | 结论 | 做法 |
|---|---|---|
| 证件号 / 手机号 / 住址 | 🟡 | 全文替换成占位符 |
| 公司名 / 客户名 / 项目名 | 🟡 | 一致替换成「A 公司」 |
| 签了 NDA 的内容 | ⛔ | 只传公开要求,正文自己写 |
| 别人的文件 | ⛔ | 除非对方让你帮忙 |
| 密码 / API key / 内网地址 | ⛔ | 一个字符都不传 |
| 自己的病历 / 合同 / 账单 | 🟡 | 去掉身份信息,数据保留 |
| 公司的财务 / 客户 / 案卷 | ⛔ | 你是经手人不是所有者 |
| 唯一一份的稿子 | ✅ | 先备份 |
| 不想留记录的内容 | ⛔ | 口头描述,用完删 |
| 图片 / 录音 | 🟡 | 先转文字再传 |
| 公司电脑 / 账号 | 看规定 | 没规定按 ⛔ 处理公司文件 |
| 传完之后 | — | 历史记录里删掉 |
把这张表存下来。真正需要判断的时候,通常 10 秒钟就能定位到某一行——多数文件是 🟡,做 3 分钟脱敏,然后放心用。这比「什么都不传」和「什么都传」都好得多。
如果你还没开始用文件功能,DeepSeek 上传文件那篇和新手 30 问里有基础操作。脱敏这件事,和上传文件本身一样,是该在第一天就养成的习惯。