国产 AI 常见的 30 个词,用大白话解释:token、上下文、推理模型、联网、幻觉、温度、满血版、蒸馏、MoE……每个词一句人话 + 一句「这对我有什么影响」
这篇是写给「用得挺多、但一直没搞懂那些词」的人。每个词只有两句:它是什么、对你有什么影响。 有影响的会展开一点,没影响的直接告诉你不用管。
分三组:第一组是你用的时候会碰到的,最该看;第二组是你选模型时会碰到的;第三组是看新闻时会碰到的,看不看都行。
四个模型(DeepSeek V4.1、Kimi K3、通义千问、GLM-5.1)在不墨 AI 助手里可以切换着用,下面凡是说「你可以试试」的,都能直接试。
第一组:用的时候会碰到(10 个)
1. token(词元)
是什么:模型计数的最小单位。中文大约 1 个字 = 1 到 2 个 token,英文大约 1 个单词 = 1 到 2 个 token。
对你的影响:所有「上下文长度」「按量计费」「输出上限」都是按 token 算的。一个粗略换算:1000 token ≈ 600–800 个汉字。 你不需要精确算,知道数量级就行。
2. 上下文(context)/ 上下文窗口
是什么:模型「一次能看到多少东西」——包括你说的、它答的、你传的文件,全加在一起的上限。
对你的影响:这是最该懂的一个词。超过上限,最早的内容会被「挤出去」,模型开始忘事——这就是「聊久了它忘了开头说什么」的原因。不同模型差别很大:Kimi K3 是 100 万 token 级别,能塞进几本书;有的模型几万 token 就满了。传长文件、聊长对话,先看这个数。Kimi K3 的长上下文能干什么,见Kimi K3 的 100 万上下文到底能干什么。
3. 提示词(prompt)
是什么:你发给它的那段话。没有更玄的意思。
对你的影响:网上有很多「提示词模板」「提示词工程」,大部分是过度包装。真正有用的就三条:素材给全、格式说清、什么不能动说明白。 展开在DeepSeek 提示词怎么写。
4. 幻觉(hallucination)
是什么:模型编造了不存在的事实,而且语气和真的一样笃定——假的航班号、不存在的法条、编的统计数字。
对你的影响:这是用 AI 最大的风险,没有之一。它不知道的时候不会说不知道,会编。 唯一的对策:它回答里所有你没提供过的具体信息(数字、日期、人名、编号)都当成待核实的。
5. 联网 / 联网搜索
是什么:让模型在回答之前先去搜一遍网页,把搜到的内容作为参考。
对你的影响:模型的知识是训练时冻结的,不开联网它不知道「最近」发生了什么。 问时效性的事(新政策、新产品、近期新闻)要开;问「怎么写一封道歉信」这种不用开,开了反而慢、还可能被搜到的垃圾内容带偏。什么时候开,见DeepSeek 联网搜索怎么用。
6. 推理模型 / 思考模式 / 深度思考
是什么:回答之前先「想一会儿」的模型——你会看到一段它的思考过程,然后才给答案。DeepSeek R1 是最有名的一个,其他模型也有对应的「深度思考」开关。
对你的影响:数学题、逻辑题、多步推理的问题,开了明显更准;写文案、闲聊、改错别字,开了只会慢,不会更好。 一个简单的判断:这题你自己做需要「算一算、推一推」的,就开;不需要的就别开。哪些题值得等,见DeepSeek R1 推理模型实战。
7. 多轮对话 / 对话历史
是什么:同一个对话里你说的和它说的都会被记住,作为后续回答的参考。
对你的影响:好处是你可以说「把第三段改短」它知道你指哪段;坏处是错误的信息也会留在历史里污染后面的回答。所以「它答错了」的正确处理是开新对话,而不是在原对话里纠正——纠正之后它只是在迎合你。
8. 系统提示 / 角色设定 / 人设
是什么:在对话开始前给它的一段「你是谁、你该怎么回答」的设定。有些产品叫「智能体」「助手预设」。
对你的影响:对大多数人,它的作用被夸大了。「你是一位资深律师」这句话不会让它的法律知识变多。真正有用的设定是「回答不超过 200 字」「不确定就说不确定」「用表格」这类格式和行为约束,不是身份。
9. 温度(temperature)
是什么:控制回答「随机性」的一个参数,数值越高越发散、越低越保守。
对你的影响:用网页版聊天的话,你碰不到这个参数,不用管。 只有调 API 的开发者才会设。如果你在某个产品里看到「创意模式 / 精确模式」,本质上就是调这个:写文案用创意,算账用精确。
10. 上传文件 / 文件解析
是什么:把 PDF、Word、Excel、图片传给模型,让它读完再回答。
对你的影响:传原文件永远比传截图好——图片识别对数字和日期的错误率高,而且错了不告诉你。另外,传上去的文件是「进了这个对话的上下文」,所以文件太大会撑爆上下文(见第 2 条)。用法在DeepSeek 上传文件读 PDF/Word/Excel。
第二组:选模型时会碰到(10 个)
11. 满血版
是什么:这是个国产特有的词。同一个模型往往有「完整版」和「缩小版」,满血版就是完整的那个。 缩小版(见第 12 条「蒸馏」)便宜、快,但笨。
对你的影响:很多免费入口给你的是缩小版,回答质量和你在别处看到的评测对不上。用之前看一眼是不是满血版。 各家满血版在哪里能免费用,见DeepSeek 满血版免费在线。
12. 蒸馏(distillation)
是什么:用一个大模型「教」出一个小模型——小模型学大模型的回答方式,体积小很多,能力也打折扣。
对你的影响:你看到「DeepSeek-R1-Distill-7B」这类名字,就是蒸馏出来的小版本。它不是 R1,是「学 R1 学了个七八成的小模型」。 能在手机、旧电脑上跑,但别拿它的表现去评价 R1 本身。
13. 参数量(7B / 32B / 671B)
是什么:模型有多少个「可调节的旋钮」,B 是十亿。数字越大通常越强,也越慢越贵。
对你的影响:用网页版的话不用管,你用的都是最大的那个。 只有自己在电脑上部署模型时才需要关心:7B 一般电脑能跑,32B 要好显卡,几百 B 的个人跑不了。
14. MoE(混合专家)
是什么:一种模型结构——模型里有很多个「专家」,每次回答只调用其中几个,而不是全部。DeepSeek V4 和很多国产模型都是这种结构。
对你的影响:没影响。 它是「为什么这个模型这么大但跑得不慢」的技术原因,你用的时候感受不到。看到这个词跳过就行。
15. 多模态
是什么:能处理文字以外的东西——看图、听声音、看视频。
对你的影响:你传图片让它读,用的就是多模态能力。注意:「能看图」和「看得准」是两回事,读图里的数字、手写体,错误率明显高于读文字。生图、生视频是另一类多模态,见AI 生图免费在线。
16. 开源 / 开放权重
是什么:模型的「文件」公开了,任何人可以下载、自己部署、改。DeepSeek、通义千问、GLM 的很多版本都开源。
对你的影响:对普通用户,直接影响是「第三方平台可以拿去部署,所以你能在很多地方用到它」——这就是为什么同一个 DeepSeek 在十几个 App 里都能选到。但第三方部署的可能是缩小版(见第 11 条)。
17. API
是什么:给程序用的接口。开发者通过它把模型接进自己的软件里,按 token 付费。
对你的影响:你用网页聊天不需要 API。 看到「API 免费额度」「API 价格」这些和你没关系。只有一种情况例外:你想用 AI 批量处理东西(比如 500 条评论逐条分类),那时候才需要接 API 或者用支持批量的工具。
18. 上下文长度 vs 输出长度
是什么:上下文长度是「它能看多少」(第 2 条),输出长度是「它一次能说多少」,两个是分开的上限。
对你的影响:「让它写一万字,它写到三千字停了」就是输出长度到了。 解法不是换模型,是分段:「先写第一部分,写完我说继续」。
19. 模型版本号(V4 / V4.1 / K3 / 3.7 / 5.1)
是什么:同一家模型的迭代编号。
对你的影响:通常新版本更强,但不是每次都值得等。 小版本(4→4.1)多半是修修补补,大版本(3→4)才是明显升级。同一家的几个版本怎么选,见DeepSeek V4.1 Flash、V4 Pro、R1 有什么区别。
20. Flash / Lite / Turbo / Pro / Max
是什么:同一代模型里的「档位」——Flash / Lite / Turbo 是快而便宜的,Pro / Max 是慢而强的。
对你的影响:日常问答、改文案用 Flash 档够了,速度快很多;写代码、算复杂的账、分析长文档用 Pro 档。 大部分时候「先用快的,不满意再换强的」是最省事的策略。
第三组:看新闻时会碰到(10 个)
这一组对「用」基本没影响,看到不慌就行。
21. 预训练 / 微调 / 对齐
是什么:模型「出厂」的三个阶段——先读海量文本学语言(预训练),再用人工整理的问答教它怎么回答(微调),最后调整它的价值观和拒答边界(对齐)。
对你的影响:没有。你用的都是三步做完的成品。
22. RLHF(人类反馈强化学习)
是什么:对齐阶段的一种具体做法——让人给模型的回答打分,模型往高分的方向学。
对你的影响:这是「为什么它总是很客气、总爱说『您的具体需求』」的技术原因。它被训练成「不犯错」优先,所以你要它「直接下判断」时得明说。
23. 知识截止日期
是什么:模型训练数据的时间下限,之后的事它不知道。
对你的影响:这就是「问它最近的事它一脸茫然」的原因,也是联网存在的原因。看新闻说某模型「知识更新到某月」,意思是它对那之前的事有印象,之后的要靠联网。
24. 基准测试 / 榜单 / 跑分
是什么:用固定的题库给模型打分,做成排行榜。
对你的影响:参考价值有限。 榜单上高 3 分低 3 分,你在实际使用里感受不到;而且题库是公开的,有些模型会「针对性复习」。选模型看你自己的任务上谁好用,比看榜单准。 我们自己做的横评是按生活任务出题的,比如5 道生活文书横评。
25. 智能体(Agent)
是什么:不只是回答问题、还能「自己去做事」的 AI——比如自己打开网页、查资料、填表、连续执行多步。
对你的影响:目前普通用户接触到的大部分「智能体」其实只是「加了人设的聊天」(见第 8 条),真能自己干活的还很早期。看到这个词别期待太高。
26. RAG(检索增强)
是什么:先从你的资料库里找出相关的段落,再把这些段落塞给模型让它回答。「企业知识库问答」基本都是这个。
对你的影响:你上传文件让它读,产品内部大概率就是用的这个。它的上限取决于「找得准不准」,找错了段落,模型答得再好也是错的。 所以问长文档时要「原文 + 页码」,方便你回头核。
27. 蒸馏 vs 量化
是什么:都是「把模型变小」的办法。蒸馏是训练一个小模型去学大模型(第 12 条);量化是把大模型的数字精度降低,比如从 16 位降到 4 位,体积缩几倍。
对你的影响:没有,除非你自己部署。区别是:量化后的还是「原来那个模型」(只是精度低了点),蒸馏出来的是「另一个模型」。
28. 幻觉率 / 拒答率
是什么:评测指标——前者是它编造的比例,后者是它「拒绝回答」的比例。
对你的影响:这两个是反着的:拒答多的编得少,编得少的拒答多。没有两个都低的模型。 你在提示词里写「不确定就说不确定」,是在手动把它往「拒答多、编得少」那边推。
29. 思维链(CoT)
是什么:让模型「一步一步想」再给答案的技术。推理模型(第 6 条)就是把这个做进了模型本身。
对你的影响:即使不用推理模型,你在提示词里加一句「一步一步分析」,普通模型也会好一些——这是最简单的思维链用法,对算账、逻辑题尤其有效。
30. 端侧 / 本地部署 / 私有化
是什么:模型跑在你自己的设备上(手机、电脑、公司服务器),不经过厂商的服务器。
对你的影响:数据不出门,这是唯一的好处;代价是只能跑小模型(第 13 条),能力差一大截。普通人用网页版就好;公司有合规要求的才需要考虑。「我的资料会不会泄露」这类问题,在国产 AI 新手 30 问里有专门一节。
30 个词里真正要记住的 5 个
看完一遍你可能记不住 30 个,那就记这 5 个,够用了:
| 词 | 一句话 | 对你的直接影响 |
|---|---|---|
| 上下文 | 它一次能看多少 | 聊久了会忘、文件太大会满 → 阶段性开新对话 |
| 幻觉 | 它会编,而且编得很像真的 | 没告诉过它的具体信息都要核 |
| 联网 | 让它先搜再答 | 问时效性的事开,问写作类的别开 |
| 推理模型 | 先想再答 | 算账逻辑题开,写文案别开 |
| 满血版 | 完整版而不是缩小版 | 用之前看一眼是不是满血 |
其余 25 个,碰到再回来查。
四个模型在不墨 AI 助手里可以直接切换,免费在线,不用装软件。如果你想先测测自己「用」的水平,10 道题测你会不会用国产 AI正好配着这篇看。