← 返回博客

让国产 AI 学会我的写作口吻:喂 5 篇旧文,DeepSeek、Kimi K3、通义千问、GLM-5.1 谁模仿得最像——3 位同事盲测打分的完整记录(附「口吻卡」提示词)

2026-09-23 · 8 分钟阅读
写作风格模仿口吻盲测横评国产 AIDeepSeekKimi K3通义千问GLM-5.1国产模型实验

用 AI 写公众号、写小红书、写周报,最常见的抱怨不是「写得差」,而是「不像我」。语气太客气、什么都要分三点、结尾一定要升华一下——熟人一看就知道不是你写的。

小红书公众号文案那篇给过「不像 AI 写的」9 个提示词,那是通用去 AI 味。这篇往前走一步:能不能让它学会具体某一个人的口吻,以及四家国产模型里谁学得最像

我们没有凭感觉下结论,做了一次盲测。

先交代立场:实验在我们自己的不墨 AI 助手里做的,四个模型在一个窗口里切换,同一份材料不用复制四遍。但方法在任何平台都能复现。


一、实验怎么做的

作者:同事 L,写了两年公司公众号,风格特点是短句多、爱用「说白了」「你想啊」这类口头语、几乎不用「首先其次」、结尾常常戛然而止不总结。

材料:L 自己挑的 5 篇旧文,每篇 1300~1800 字,选题都是「怎么用某个工具」这类。

任务:给一个 L 没写过的新选题(「怎么让新同事三天上手我们的协作软件」),四个模型各写一篇 1500 字左右。L 本人也写一篇。

提示词(四家完全一样):

下面是同一位作者的 5 篇文章。请先读完,总结出这位作者的写作特征:句子长短、常用口头语、段落组织方式、开头和结尾的习惯、绝对不会用的表达。
总结好之后,用完全一样的口吻写一篇新文章,选题是「怎么让新同事三天上手我们的协作软件」,1500 字左右。
要求:读者看不出这是另一个人写的。不要在文中提到「这位作者」,直接以第一人称写。

【文章 1】……
【文章 2】……
(略)

盲测:5 篇文章去掉署名、打乱顺序、统一排版,发给 3 位和 L 共事一年以上的同事。每人做三件事:① 挑出哪篇是 L 本人写的;② 给每篇打「像不像 L」1~5 分;③ 写下露馅的地方。


二、结果

谁被当成了真人

篇目实际作者被评委 A 选为真人评委 B评委 C
第 1 篇通义千问 3.7
第 2 篇L 本人
第 3 篇DeepSeek V4.1
第 4 篇GLM-5.1
第 5 篇Kimi K3

DeepSeek 的那篇骗过了 3 人中的 2 人。 事后问评委 A,他说「第 3 篇里有句『你想啊,人家第一天来连群都没进』,这太 L 了」。评委 B 选对了,理由是「第 2 篇结尾太突然,只有 L 会这么收」——而 DeepSeek 那篇结尾多了一句「试试看吧」。

「像不像」平均分

模型评委 A评委 B评委 C平均一句话评价
DeepSeek V4.15454.7口头语和句子节奏都抓到了,结尾稍微多了一句
Kimi K34433.7句子节奏像,但太「稳」,少了 L 偶尔的跑题
通义千问 3.73343.3口头语都用了,但用得太密,像在表演
GLM-5.12222.0全员一眼识破:分了「一、二、三」,L 从来不这么写
L 本人4544.3(作为参照)

有意思的是L 本人的分数没拿满——评委 A 和 C 都觉得「像是像,但比平时正经了点」。L 承认那天写得比较赶。这反过来说明:DeepSeek 那篇的 4.7 不是巧合,它写出来的东西比作者本人的即兴发挥更「典型」。

各家露馅在哪

评委写下的露馅点,按模型归类:

  • GLM-5.1:「用了『首先』『其次』」「每段开头都是总起句」「结尾升华了」——它把 5 篇文章的内容学了,结构完全没学,还是自己的默认套路。
  • 通义千问:「『说白了』出现了 6 次,L 一篇最多用 2 次」「有一段连续三个反问」——学到了标志性表达,但没学到频率,用力过猛。
  • Kimi K3:「每段长度太均匀」「没有一处跑题,L 每篇都会岔开讲个无关的小事」——最难挑毛病的一篇,但也因此太干净,缺了个人写作里的毛边。
  • DeepSeek:「倒数第二段有点像总结」「多了一句『试试看吧』」——问题都在结尾,前面 1300 字没人挑出毛病。

三、从实验里提炼出来的「口吻卡」

实验之后我们又换了两位同事重复了一遍(没做完整盲测,只看像不像),结论稳定:DeepSeek 最像,Kimi 次之,GLM 最不像。 但更有用的发现是——不管用哪家,只要把「作者特征」这一步的输出单独存下来,下次直接贴,效果比每次重新喂 5 篇文章更稳。

这就是「口吻卡」。做法:

第 1 步:喂 5 篇旧文,只要它总结特征,先不写:

下面是同一位作者的 5 篇文章。请总结这位作者的写作特征,分这几项写,每项给 2~3 个原文例子:
1. 句子长度和节奏(平均多长、长短句怎么交替)
2. 口头语和标志性表达(列出来,并注明大约每千字出现几次)
3. 段落怎么组织(有没有小标题、段落长短、会不会跑题)
4. 开头习惯
5. 结尾习惯
6. 绝对不会出现的表达和结构
只做总结,不要写新文章。

第 2 步:把输出通读,删掉它总结错的,补上它没看出来的。这一步必须人来做——四个模型的总结都有一两处不对。L 补了一条「结尾从不总结,最后一句往往是个具体动作或半句话」,这条后来最有用。

第 3 步:存成一段文字。以后每次写东西,第一条消息就是:

下面是我的写作口吻卡,请严格按这张卡的特征写,尤其注意第 2 项的出现频率和第 6 项的禁用清单:
【口吻卡】
(贴上第 2 步改好的内容)

选题:……
字数:……

用口吻卡之后,通义千问「用力过猛」的问题基本消失了——因为卡里写明了「『说白了』每千字不超过 2 次」。GLM-5.1 分点的毛病也压住了大半,因为第 6 项写了「不用一二三分点」。差距缩小了,但 DeepSeek 仍然最像。


四、几条实用建议

  1. 5 篇是够用的下限。试过喂 2 篇,总结出来的特征太宽泛;喂 10 篇和 5 篇差别不大,而且更容易撑满对话(上下文那篇讲过为什么)。
  2. 选题材相近的旧文。你写工作总结和写朋友圈是两种口吻,别混着喂。
  3. 结尾要单独盯。四家模型露馅最集中的地方都是结尾,写完先看最后三句。
  4. 口吻卡不是一次性的。用一个月之后回头改一改,把这段时间里你发现的新露馅点补进第 6 项。
  5. 别指望它替你写观点。口吻能学,你对一件事的看法学不了——这次实验里四篇 AI 文的观点都是「平均水平」,L 本人那篇有一个只有他会提的反对意见。国产 AI 做不好的 10 件事里第 7 条就是这个。

最后

「AI 写的一眼就看得出来」,准确的说法是「没教过的 AI 写的一眼就看得出来」。喂 5 篇、做一张口吻卡、盯住结尾,这三步做完之后,至少在我们这个小实验里,最像的那家能骗过三分之二的熟人。

如果你想自己复现,选一家模型就够了——从结果看,先试 DeepSeek。