同一份 28 页劳动合同让 DeepSeek、Kimi K3、通义千问、GLM-5.1 一起读:找风险条款、答 8 个细节题、看谁漏了什么——长文档理解横评
前面两篇横评(5 道生活算术题、5 道改写润色题)测的是模型「写」和「算」的能力,这篇换个方向:读一份长的、无聊的、真有坑的文件,它们到底能不能读完、读对。
选劳动合同是因为它够真实——几乎每个人都签过、几乎没人逐字看过,而且坑通常不在正文里,藏在附件。
测试材料和方法
文件:一份 28 页的劳动合同 PDF(朋友入职一家中型互联网公司时签的,脱敏后使用),结构是:
- 正文 11 页:期限、岗位、薪酬、工时、保密、竞业、解除条款
- 附件一(6 页):《薪酬与绩效管理办法》
- 附件二(7 页):《保密及竞业限制协议》
- 附件三(4 页):《员工手册确认书》,其中引用了另一份不在 PDF 里的《员工手册》
模型:DeepSeek V4.1(非推理模式)、Kimi K3、通义千问 Qwen 3.7 Max、GLM-5.1。全部在不墨 AI 助手里上传同一个 PDF,同一段提示词,每个模型跑一遍,不重试。
三道题:
- 找风险:「列出这份合同里对员工不利、或者签之前应该跟 HR 确认的条款,每条注明在第几页、原文是什么、为什么不利。」
- 8 个细节题:答案全在附件里,正文找不到(下面逐题贴)
- 找缺失:「按《劳动合同法》第十七条的必备条款,这份合同缺了什么?另外它引用了哪些不在这份文件里的其他文件?」
评分标准很简单:说对给分,说错扣分,编造的扣双倍。 长文档任务里「自信地编」比「老实说不知道」危害大得多。
第一题:找风险条款
这份合同里我自己(配合一位做法务的朋友)预先标了 7 处需要注意的地方:
| # | 位置 | 内容 | 为什么要注意 |
|---|---|---|---|
| 1 | 正文 P3 | 试用期 6 个月,合同期 3 年 | 合法,但 3 年期试用期上限就是 6 个月,顶格用了 |
| 2 | 正文 P4 | 「基本工资」6000,其余为「绩效工资」 | 底薪占比低,绩效部分依据附件一的办法发放 |
| 3 | 附件一 P2 | 绩效 C 级及以下当月绩效工资为 0 | 「绩效工资」实际可全额扣光 |
| 4 | 附件一 P4 | 年终奖「以在职为发放条件」 | 年底前离职一分没有 |
| 5 | 附件二 P3 | 竞业限制期 24 个月,补偿金为「离职前 12 个月平均工资的 30%」 | 30% 是法定下限,24 个月是上限,两头都往对公司有利的方向取 |
| 6 | 附件二 P5 | 违反竞业限制违约金「50 万元或已领补偿金的 5 倍,取高者」 | 数额明显偏高 |
| 7 | 附件三 P2 | 「本人已阅读并同意《员工手册》全部内容」,但手册不在合同附件里 | 签了一份没看过的文件 |
四个模型的表现:
DeepSeek V4.1:找到 1、2、3、5、6,共 5 处。漏了 4(年终奖在职条件)和 7(员工手册)。页码 5 处全对。多说了一条「保密义务无期限」——这条其实合法且常见,算过度解读,不扣分。
Kimi K3:找到全部 7 处。页码全对,而且第 7 条它是四个里唯一指出来的,原话是「附件三要求确认已阅读《员工手册》,但该手册未包含在本文件中,建议签署前索取并阅读」。多说了两条:一条是「工作地点写的是『公司所在城市及公司安排的其他地点』」(这条确实值得提,我漏标了),另一条是「加班需审批」(这是标准条款,算凑数)。
通义千问 Qwen 3.7 Max:找到 1、2、3、5,共 4 处。第 6 条说错了——它写的是「违约金为 50 万元」,漏了「或已领补偿金的 5 倍,取高者」这半句,而这半句才是重点。页码有一处错,把附件一 P2 写成了「附件一第 3 页」。
GLM-5.1:找到 1、2、5、6,共 4 处。漏了 3(绩效为 0 那条)——这条藏在附件一的一张表格里,GLM 明显没把表格读进去。页码全对。它另外多列了 3 条,其中一条「未约定社保缴纳基数」是对的(合同里确实只写了「依法缴纳」没写基数),另外两条是重复正文里已有的内容。
| 模型 | 找到 / 7 | 说错 | 页码错 | 额外有价值发现 |
|---|---|---|---|---|
| DeepSeek V4.1 | 5 | 0 | 0 | 0 |
| Kimi K3 | 7 | 0 | 0 | 1(工作地点) |
| 通义千问 | 4 | 1 | 1 | 0 |
| GLM-5.1 | 4 | 0 | 0 | 1(社保基数) |
这题 Kimi K3 明显领先,而且赢在「附件三」这种一般人根本不会翻到的地方。
第二题:8 个细节题
这 8 题的答案全在附件里,我故意问得很具体,看它们是「真读了」还是「猜的」。
| # | 问题 | 正确答案(位置) |
|---|---|---|
| Q1 | 绩效考核一年几次? | 每季度一次(附件一 P1) |
| Q2 | 绩效分几个等级? | S/A/B/C/D 五级(附件一 P2) |
| Q3 | 年终奖在哪个月发? | 次年 3 月(附件一 P4) |
| Q4 | 竞业限制补偿金按月还是一次性发? | 按月,离职后每月 10 日前(附件二 P3) |
| Q5 | 竞业限制涉及的「竞争企业」列表在哪? | 附件二 P6 附表,列了 9 家公司 |
| Q6 | 离职时保密资料要在几天内归还? | 3 个工作日(附件二 P4) |
| Q7 | 员工手册确认书的签署日期和合同日期一样吗? | 不一样,晚了 2 天(附件三 P4) |
| Q8 | 合同里有没有写调岗需要员工书面同意? | 没有,写的是「公司可根据经营需要调整」(正文 P5) |
结果:
| 题 | DeepSeek V4.1 | Kimi K3 | 通义千问 | GLM-5.1 |
|---|---|---|---|---|
| Q1 | ✅ | ✅ | ✅ | ✅ |
| Q2 | ✅ | ✅ | ✅ | ❌ 答「四级 A/B/C/D」 |
| Q3 | ✅ | ✅ | ❌ 答「次年 1 月」 | ✅ |
| Q4 | ✅ | ✅ | ✅ | ✅ |
| Q5 | ⚠️ 答「附件二」但没说有几家 | ✅ 「9 家,列在附件二末尾附表」 | ❌ 答「合同未列出具体企业」 | ⚠️ 答「附件二」,说「约 10 家」 |
| Q6 | ✅ | ✅ | ✅ | ✅ |
| Q7 | ❌ 答「一致」 | ✅ | ❌ 答「一致」 | ❌ 答「文件未显示签署日期」 |
| Q8 | ✅ | ✅ | ✅ | ✅ |
| 对 / 8 | 6.5 | 8 | 5 | 5.5 |
几个值得说的细节:
- Q7 是这轮的分水岭。签署日期在附件三最后一页的右下角,字很小,是扫描的手写日期。只有 Kimi K3 读出来了。DeepSeek 和通义都答「一致」——这是编的,因为它们根本没读到那一页就默认一致了。GLM 说「未显示」是老实的,不扣分。
- Q2 GLM 答错和第一题漏第 3 条是同一个原因:附件一 P2 那张绩效等级表它没读进去。GLM-5.1 对 PDF 里的表格识别明显弱于另外三个。
- Q3 通义答「1 月」——附件一 P4 原文是「于次年 3 月随当月工资发放」,「1 月」不知道从哪来的,属于典型幻觉。
- Q5 的「约 10 家」(GLM)比「附件二」(DeepSeek)更糟:前者是编了个数,后者只是不够具体。
第三题:找缺失
《劳动合同法》第十七条列了 9 项必备条款。这份合同实际缺了两项:社会保险的具体约定(只写了「依法缴纳」)和劳动保护、劳动条件和职业危害防护(完全没提)。引用的外部文件有两份:《员工手册》和附件二里提到的《信息安全管理规定》。
- DeepSeek V4.1:找出「职业危害防护」缺失,社保那条说「已约定」(错,它把「依法缴纳」当成约定了)。外部文件找到《员工手册》,漏了《信息安全管理规定》。
- Kimi K3:两项缺失都找到,外部文件两份都找到,还额外指出「附件三引用的《员工手册》版本号未注明,建议要求 HR 提供带版本号的正式版本」。
- 通义千问:找出「职业危害防护」缺失。外部文件只找到《员工手册》。另外它说合同缺「工作时间和休息休假」——这是错的,正文 P5 有整整一节,它没读到。
- GLM-5.1:两项缺失都找到(社保基数那条它在第一题就提过了)。外部文件找到《员工手册》,漏了《信息安全管理规定》。
总分和结论
| 模型 | 找风险 | 8 细节题 | 找缺失 | 编造次数 | 总评 |
|---|---|---|---|---|---|
| Kimi K3 | 7/7 | 8/8 | 全对 | 0 | 28 页读完读对,唯一一个能把扫描页角的日期读出来的 |
| DeepSeek V4.1 | 5/7 | 6.5/8 | 1 错 1 漏 | 1(Q7) | 正文读得好,附件后半段开始走神 |
| GLM-5.1 | 4/7 | 5.5/8 | 1 漏 | 1(Q5 「约 10 家」) | 表格识别弱,非表格部分没大问题 |
| 通义千问 | 4/7 | 5/8 | 1 错 1 漏 | 3(Q3、Q7、「缺工时条款」) | 编造最多,第 15 页以后的内容明显不可靠 |
三个观察:
第一,长文档任务的差距比写作任务大得多。 改写润色横评里四个模型差不多打平,这次 Kimi K3 和通义之间的差距是「能用」和「不能信」的区别。原因不神秘:Kimi K3 的100 万 token 上下文让它真的把 28 页全装进去了,其他模型对后半段是「大致扫了一眼」。
第二,「走神」的位置是可预测的。 DeepSeek 和通义的错误全部出现在附件里,正文部分 100% 正确。所以如果你用的是这两个模型,把附件单独拆出来再上传一次,准确率会明显上去。
第三,表格是 GLM 的盲区。 两处错误都是表格里的内容。如果合同关键信息在表格里(薪酬结构、绩效等级、竞争企业列表),用 GLM 之前先把表格内容复制成文本贴进去。
我现在读合同的实际流程
这次测完之后,我自己的做法固定成这样:
- Kimi K3 先整份读,跑第一题和第三题的提示词,拿到风险清单和缺失清单
- 每一条风险让它「贴原文 + 页码」,我自己翻到那一页核一遍——Kimi 这次全对,但合同这种东西不能全信任何模型
- 附件多的合同,再用 DeepSeek 单独读一遍附件,两个模型的清单对一下,只出现在一边的条目重点看
- 拿着清单去问 HR,具体怎么问、哪些能谈,用 AI 审合同和劳动法律问题怎么问 AI里写得更细
附:三道题的完整提示词
第一题:
这是一份劳动合同,含 3 个附件。请通读全文(包括所有附件),列出对员工不利、或签署前应向 HR 确认的条款。每一条按「第 X 页 / 原文摘录 / 为什么需要注意」的格式写。不要列标准的、法律要求必须有的条款。如果某处内容你没读到或不确定,直接说「未读到」,不要推测。
第二题(8 题一次发):
只根据这份文件回答以下问题,每题注明答案在第几页。文件里找不到的直接答「文件未提及」,不要根据常识补:
- 绩效考核一年几次?……(8 题)
第三题:
对照《劳动合同法》第十七条的必备条款,这份合同缺少哪几项?另外列出这份合同引用了但没有包含在文件里的其他文件名称。
四个模型都在不墨 AI 助手里,上传 PDF 后可以直接切换模型跑同一段提示词,免费、国内直连、不用装软件。上传方法和文件大小限制见DeepSeek 上传文件读不了怎么办。