基础概念
这是完整参考版:55个术语,先给定义,再讲细节。如果你想要更轻松的版本,只讲你第一周真正用得上的那几个词,请先读AI术语解释,遇到这里的某个词把你引过来时再回来查。
人工智能
人工智能是能完成通常需要人类判断力的任务的软件,比如写作、推理,或者识别一张图片里有什么。
在2026年的日常用语里,“AI”几乎总是指基于大语言模型的聊天助手,而不是那个更宽泛的学术领域。
机器学习
机器学习是一种教会软件的方法:给它看大量例子,而不是给它写死一套规则。
现在的每一个AI助手都是这样造出来的:它的行为来自训练数据里的规律,这也是为什么同一个模型在常见任务上表现出色,在罕见任务上却会摇摇晃晃。
模型
模型是一个具体的、已经训练好的AI系统,也就是你真正把提示词发给的那个东西。
GPT、Claude和Gemini都是模型家族;一个家族里包含好几个具体模型,大小、速度和价格各不相同。按任务在它们之间做选择,正是把AI用好的核心技能。
LLM(大语言模型)
LLM,也就是大语言模型,是一种用海量文本训练出来、专门预测接下来该出现什么文字的模型。
把这一个小把戏做到极大的规模,就产生了答案、草稿、代码和摘要。“大”既指训练数据的体量,也指参数的数量。
聊天机器人
聊天机器人是包在模型外面的那层对话界面,就是那个带输入框的东西。
比较产品的时候这个区分很要紧:两个聊天机器人可能包着同一个模型,用起来却完全不同;一个聊天机器人也可能提供好几个模型,Whizi就是这么做的。
提示词
提示词是你发给模型的一切:问题、指示,以及你附上的任何文字或文件。
答案的质量和提示词的质量紧密挂钩。背景信息、限制条件,以及你想要的输出格式,是新手最常漏掉的三样东西。
Token
token是模型实际读取和写出的最小文本单位,英文里平均大约相当于四分之三个单词,中文里一个汉字通常算一到两个token。
计费、速度和上下文窗口全都按token计量,这也是为什么这个词会出现在每一张AI价格表上。一份一千字的英文文档大约是1,300个token。
上下文窗口
上下文窗口是模型一次能同时纳入考虑的最大文本量,用token计量。
你的提示词、到目前为止的整段对话、附上的文档,以及最终生成的答案,全都共用这个窗口。上下文窗口对比这张表列出了每个主流模型目前的数字,这篇讲解说清了为什么大多数“AI忘事了”的抱怨都能用它解释。
参数
参数是模型在训练过程中学到的内部数值,通常也是衡量模型大小的标准。
参数以十亿为单位计算,参数越多大致意味着能力越强、成本也越高。单看参数数量并不是一个好的选购标准;跑分和你自己动手测试都比参数数量更靠谱。
回复
回复是模型针对一条提示词给出的输出,也叫completion。
每一次回复都是重新生成的,这就是为什么对同一条提示词重新生成,措辞会不一样,有时答案本身也会不一样。
和模型对话
系统提示词
系统提示词是模型在收到你的消息之前先拿到的一段常驻指令,用来设定它的角色、语气和规则。
每一个产品背后都有一段系统提示词,哪怕你看不见它。一个聊天机器人“有性格”,通常就是系统提示词在起作用。
提示词工程
提示词工程是有意识地打磨提示词、让输出稳定变好的做法。
名字听起来唬人,做的事其实大多是普通的说清楚:讲明目标,给出背景,举个例子,说清格式。新手指南讲的是真正能改变结果的那些技巧。
零样本(Zero-shot)
零样本指的是让模型做一件事,却不给它任何示例。
现在的模型在零样本情况下就能应付大部分日常任务。这个词之所以还在用,主要是为了和“少样本”提示法做对比。
少样本(Few-shot)
少样本指的是在提示词里放进几个做好的示例,让模型照着模式来。
对格式要求严格的活儿来说,这是成本最低的可靠性提升手段:两三个“输入配上想要的输出”的例子,效果胜过一整段描述。
思维链
思维链指的是模型在给出最终答案之前,先把中间步骤过一遍。
让模型一步一步推理,在难题上能带来看得见的提升,而如今的推理模型默认就会在内部做类似的事情。
温度
温度是控制模型在选每一个下一个token时加入多少随机性的设置。
温度低,输出稳定、保守;温度高,输出多样,偶尔也会出现胡言乱语。聊天产品通常已经替你选好了一个中间值。
流式输出
流式输出指的是模型一边生成一边把答案逐个token发出来,而不是等全部写完才一次性给你。
这就是为什么答案看起来像是在自己打字,也是为什么一个不对劲的答案可以提前叫停,不必等它写完。
重新生成
重新生成指的是针对同一条提示词,再要一个新的回复。
因为生成过程带有概率性,重新生成是真正重新抽一次答案,而不是把同一次计算再跑一遍。把两次结果放在一起比较,或者把同一条提示词丢给两个模型比较,是一种很快的质量检查方式。
模型是怎么造出来的
训练
训练是不断根据数据调整模型参数、直到它的预测变好的过程。
这一切都发生在你见到这个模型之前,要花掉厂商海量的算力。你在对话里打的任何字,都不会当场重新训练这个模型,不过根据各家的政策,厂商可能会用对话去训练未来的版本。
训练数据
训练数据是模型学习时用到的文本和其他材料。
训练数据的广度决定了模型知道什么,它的缺口决定了模型系统性的盲区,它的时间范围则决定了知识截止日期。
预训练
预训练是训练的第一个、也是规模最大的阶段,模型在这个阶段从海量文本里学习语言和世界知识。
预训练出来的模型有能力,但还很生涩。让模型表现得像一个乐于助人的助手,靠的是后面的步骤。
微调
微调是在一个更窄的数据集上给一个预训练好的模型做额外训练,让它专精某件事或者调整它的风格。
厂商用微调来提升“有用”和“安全”这两方面;公司用微调来适配自己领域的任务。对大多数用户来说,好的提示词配上一个能力强的通用模型,效果胜过花钱做一次微调。
RLHF
RLHF,即基于人类反馈的强化学习,是用人类对模型答案的评分去训练模型。
这在很大程度上解释了为什么现在的AI助手说话有礼貌、条理清楚、又比较谨慎。做过头了,也会产生那种让某些模型拒答或者含糊其辞的过度小心。
对齐
对齐是让模型的行为符合人类意图和价值观的那部分工作。
实际做起来,这既包括拒绝有害的请求,也包括老老实实按指示把事情做对。当一个模型技术上做得很漂亮,结果却不是你想要的,那就是一个对齐上的缺口。
推理(运行阶段)
推理指的是运行一个已经训练好的模型来生成答案,和训练相对。
你发的每一条消息都会触发一次推理,token计价衡量的正是推理的成本。运行成本低的模型也可能能力很强;AI模型成本指数显示价格差距能达到2,000倍。
Transformer
Transformer是几乎所有现代语言模型背后的神经网络架构。
它的关键机制叫注意力机制,让模型能把输入的每一部分和其他每一部分放在一起权衡。你完全不需要弄懂细节,但这个词在AI相关的文章里到处都是。
出错的时候
幻觉
幻觉指的是模型用十足的自信说出一件不真实的事。
这不是一个下个版本就能修好的小毛病,它是生成方式本身带来的结果。出现的频率因模型和任务而异。任何具体的事实、数字或引用,在核实之前都当作未经验证。AI为什么会出错讲了其中的机制。
事实锚定(Grounding)
事实锚定指的是给模型提供权威材料让它照着回答,而不是任它凭记忆作答。
把合同贴进去、附上报告、开启联网搜索,都算事实锚定。这是日常对抗幻觉最有效的办法。
偏见
偏见指的是模型的输出系统性地偏向某个方向,这种倾向是从训练数据里继承来的。
它会表现为对人、地方和默认设定的种种假设。对有实际后果的决定,审查AI的输出要像审查一个聪明但没经过背景审查的实习生的作品一样认真。
护栏机制
护栏机制是厂商围着模型建起来的一套限制,用来挡住有害或者不合规的输出。
不同厂商画的线不一样,这是产品之间真实存在的差异:同一个请求,一个模型会回答,另一个可能会拒绝。
越狱
越狱指的是精心设计的一条提示词,目的是骗过模型,让它无视自己的护栏机制。
厂商在持续不断地修补这些漏洞。对普通用户来说,这个词的意义主要是一个安全概念:任何模型能被说动去做的事,都会有人尝试说动它去做。
红队测试
红队测试指的是在模型发布之前刻意攻击它,找出可能造成伤害的失效方式。
厂商会组织内部和外部的红队,公开的模型说明文档里通常会总结他们的发现。这相当于AI领域的渗透测试。
知识截止日期
知识截止日期指的是模型训练数据到此为止的那个日期。
问它这个日期之后发生的事,模型要么承认自己不知道,要么在能联网的情况下去搜索,要么就开始编。知道自己用的模型的截止日期,能避免一整类错误。
检索和你的数据
RAG(检索增强生成)
RAG,也就是检索增强生成,是先去找出相关文档,再让模型照着这些文档来回答。
这就是“和你的知识库聊天”这类产品在底层运作的方式,也是它们能给出引用来源的原因。RAG能减少幻觉,但答案的质量取决于它检索到的东西本身够不够好。
嵌入(Embedding)
嵌入是一串代表一段文本含义的数字。
意思相近的文本会得到相近的数字,这让软件可以用数学的方式找到相关的段落。嵌入是语义搜索和RAG背后的机械装置。
向量数据库
向量数据库是专门用来存放嵌入、并且能快速找出最接近的那些的数据库。
如果一个产品说它为了AI搜索给你的文档做了“索引”,那每一块文档对应的嵌入,就存放在这样一个向量数据库里。
语义搜索
语义搜索是按含义而不是按关键词匹配来找文本。
搜索“钱的问题”可能会找出一段讲现金流紧张的内容,哪怕一个词都对不上。这就是嵌入在实际发挥作用。
分块
分块是把长文档切成足够小的片段,方便做嵌入和检索。
这听起来像是些底层管道工作,确实也是,但分块分得不好,正是文档对话工具从文件里错误部分找答案的常见原因。
联网搜索
AI里的联网搜索指的是模型在作答前先去抓取当下的网页,而不是只靠训练时记下的东西。
这是用速度换新鲜度,也让答案能带上你可以点开查看的引用来源。对于模型知识截止日期之后发生的事,这就是一个真正的答案和一个瞎猜之间的区别。
知识库
知识库是一家公司精心整理出来、交给自己的AI照着回答的一批文档。
进去的东西质量高,出来的答案质量才会高:一个建立在过时wiki上的助手,会自信满满地给出过时的答案,还附带引用。
这份词汇表里有三个术语,回答的其实是同一个问题的三种不同思路:怎么让模型在你的任务上表现得更好,而把它们弄混,是产品会议里最常见的行话错误。放在一起对比:
| 方法 | 改变的是什么 | 成本和速度 | 什么时候赢 |
|---|---|---|---|
| 更好的提示词(零样本、少样本) | 只改变你发送的文字 | 免费,几分钟就能做 | 几乎永远是第一步该做的事;两三个做好的示例就能解决大多数格式问题 |
| RAG | 模型作答前读到的内容 | 搭建成本中等,不用重新训练 | 答案必须保持最新,或者要引用你自己的文档 |
| 微调 | 模型自身的参数 | 又慢又贵,一旦做完就定型了 | 大规模场景下需要稳定的风格和格式要求,个人几乎用不上 |
文字之外
多模态
多模态指的是一个模型能同时处理不止一种媒介,比如文字加图片、音频或者视频。
这就是为什么你可以截一张报错的图丢给它,问它哪里出了问题。多模态AI指南讲的是现在真正能用的那些功能。
视觉模型
视觉模型是能够理解图像的模型:照片、截图、图表和文档都算。
看得懂和画得出来是两码事;一个模型可以把你的示意图描述得分毫不差,却依然画不出一张来。
图像生成
图像生成是根据一段文字描述生成全新的图像。
不同生成器在质量、风格范围,以及图像里文字的呈现效果上差别很大,这就是为什么认真的用户会多比较几家。图像生成器盘点会持续跟进这个领域的最新情况。
扩散模型
扩散模型生成图像的方式是从一片噪点开始,一步一步朝着描述的方向打磨出图像。
这是现在的图像生成器背后占主导地位的技术。知道这个词,主要是为了看到产品名字里出现“diffusion(扩散)”时,能明白这个产品是做什么的。
语音转文字
语音转文字是把说出来的音频转写成书面文字。
现在的转写已经准确到可以让会议、语音笔记和采访变得可以搜索,聊天应用里的语音输入功能也是靠这个实现的。
文字转语音
文字转语音是把书面文字变成说出来的音频。
现在的系统能生成自然、有表现力的声音,朗读功能和AI语音对话都是靠它撑起来的。
更大的生态
API
API是开发者用来从自己的软件里向模型发送提示词的那扇编程接口。
API按token计价,每一款AI产品每条答案背后的经济账,归根结底都是从这里算出来的。
开放权重
开放权重指的是一个模型训练好的参数被公开发布,任何人都能下载下来运行。
这让自行部署成为可能,也让其他厂商可以在自己的基础设施上提供这个模型的服务。DeepSeek和Llama是最有名的例子。
开源模型
开源模型大致上是指发布出来供公众使用和修改的模型,不过各家的许可证条款差别很大。
实际要问的问题永远是同样那两个:能不能商用,谁来替你把它部署起来。当隐私或者成本让你没法用托管的旗舰模型时,开放权重生态才最要紧。
基准测试
基准测试是用来给模型打分、做对比的标准化测试。
用来做第一轮筛选还算有用,但在营销宣传里经常被过度利用。一个跑分第一的模型,在你的实际工作里照样可能输,这就是为什么自己动手跑三个任务做对比,胜过读跑分图表。
智能体
智能体是一种朝着目标一步步采取行动的AI系统,而不只是回答你一次就完事。
订票、做调研、写代码、提工单,这些都是智能体的地盘。这种能力是真实存在的,而且进步很快;与此同时,在事情造成影响之前审查一遍智能体做了什么,这个需求也同样在增长。
工具调用
工具调用,也叫函数调用,是模型去调用外部能力,比如搜索、计算器、代码执行,或者你的日历。
这是聊天助手能对现实世界采取行动、而不只是描述它的方式,也是智能体背后的运作机制。
推理模型
推理模型是一种在作答之前,会花额外的算力在内部把问题想一遍的模型。
这是用时间和成本,换难题上的准确度。对简单问题来说,多想这一步没什么用,这也是按任务切换模型的另一个理由。
延迟
延迟是从你发出提示词,到答案抵达或者开始流式输出之间要等的时间。
延迟因模型大小、负载情况,以及是不是推理模型而不同。在需要来回互动的工作里,一个快、够用的模型常常胜过一个慢、但很出色的模型。
速率限制
速率限制是厂商设定的一个上限,规定你在某个时间窗口内能用多少次请求或多少token。
聊天产品让你等一等或者升级方案,通常就是因为撞上了速率限制。订阅方案里的消息条数上限,其实就是包装得更友好一点的速率限制。
让这份词汇表保持有用
术语在这个领域老化得很快。这个页面是作为一份持续维护的参考资料来打理的:用法一旦变了,词条就会重写,链接的深度指南则承载着那些放不进一条定义里的细节。
如果你在别处碰到一个这里没收录的词,最快的办法是把你看到它的那句话贴给一个够强的模型,请它结合上下文给出定义。在Whizi里你可以同时问两个模型,留意它们什么时候意见不一致,对新出现的行话来说,这种情况出现的频率高得出乎意料。
- 先引用那句一句话的定义,动手用之前再读一遍细节。
- 两个来源对同一个词的定义不一样时,在AI领域通常是更新的用法说了算。
- 先学会token、上下文窗口和幻觉这三个词,其他大多数术语都是围着它们转的。
- 对模型的陌生说法,拿自己动手做的三任务对比去验证。
- 如果这个页面读起来像一本工具书,那就先去看新手版词汇表,因为这里本来就是一本工具书。
常见问题
AI、机器学习和LLM之间有什么区别?
AI是一个宽泛的目标:让软件去完成需要人类判断力的任务。机器学习是教会软件的方法,靠给它看例子,现在几乎所有的AI都是这么造出来的。LLM是机器学习出来的一种模型,专门用文本训练,ChatGPT、Claude和Gemini背后用的正是这一类。
AI里的RAG是什么意思?
RAG全称是检索增强生成:系统先去找出相关的文档,再让模型照着这些文档回答,而不是凭记忆作答。这是那些能和你的文件或知识库对话的产品背后的标准技术,也是它们能给出引用来源的原因。
微调和RAG有什么区别?
微调是用额外的训练去改变模型本身,过程又慢又一旦做完就定型了。RAG不动模型,只是在提问的那一刻把对的文档递给它,灵活而且能保持最新。要让一个助手跟得上不断变化的信息,RAG几乎永远是更合适的工具;微调适合的是稳定不变的风格和格式要求。
AI里的token是什么?
token是模型读取和写出文本时用的单位,英文里大约相当于四分之三个单词。计费、速度和上下文窗口全都用token来衡量。一份一千字的英文文档大约是1,300个token。
这些术语我到底需要记住多少个?
日常使用的话,大约五个就够了:模型、提示词、token、上下文窗口和幻觉。这份词汇表的新手版会更有耐心地讲这几个。这个页面剩下的部分,是留给某个产品页面或某篇文章突然甩给你一个生词的那一刻用的。