頭一批基礎概念
這是完整參考版:55個術語,先講定義,再補細節。如果你想要的是比較溫和、只涵蓋第一週用得到的詞彙導覽,可以先讀AI術語白話解釋,等這裡的某個詞把你帶過來時再回來看。
人工智慧(Artificial intelligence)
人工智慧是能執行原本需要人類判斷力的任務的軟體,例如寫作、推理,或辨認一張圖片裡有什麼。
在2026年的日常用法裡,「AI」幾乎都是指建立在大型語言模型上的聊天助理,而不是那個範圍更廣的學術領域。
機器學習(Machine learning)
機器學習是一種用範例來教會軟體,而不是用規則把它寫死的技術。
現代每一款AI助理都是這樣打造出來的:它的行為來自訓練資料裡的規律,這也是為什麼同一個模型,在常見任務上可能表現亮眼,在罕見任務上卻不太穩。
模型(Model)
模型是一套特定的、訓練過的AI系統,也就是你實際送出提示詞的那個對象。
GPT、Claude和Gemini是模型系列,一個系列底下包含好幾個大小、速度和價格各不相同的個別模型。依任務選擇合適的模型,是把AI用好的核心技能。
LLM(大型語言模型)
LLM,也就是大型語言模型(large language model),是一種用大量文字訓練出來、用來預測接下來該出現什麼文字的模型。
把這個單一的技巧做到夠大的規模,就產生了答案、草稿、程式碼和摘要。「大型」指的是訓練資料的量,也指參數的數量。
聊天機器人(Chatbot)
聊天機器人是包在模型外面的那個對話介面,就是那個有訊息輸入框的東西。
比較產品的時候,這個區別很重要:兩款聊天機器人可以包著同一個模型,用起來卻感覺不一樣,而一款聊天機器人也可以同時提供好幾個模型,Whizi就是這樣運作的。
提示詞(Prompt)
提示詞是你送給模型的所有內容:問題、指示,以及你附上的任何文字或檔案。
答案的品質跟提示詞的品質緊密相關。背景脈絡、限制條件,還有你想要的輸出格式,是新手最常漏掉的三件事。
Token
token是模型實際讀取和寫出的最小文字單位,平均大約是四分之三個英文單字。
價格、速度和上下文視窗,全部都是用token來計算的,這也是為什麼每一個AI價格頁面上都會看到這個詞。一份1,000字的文件,大約是1,300個token。
上下文視窗(Context window)
上下文視窗是模型一次能考慮的最大文字量,以token計算。
你的提示詞、到目前為止的對話、附加的文件,還有答案本身,全部都共用這個空間。上下文視窗比較表列出了每個主要模型目前的數字,而說明文章則解釋了為什麼「AI忘記了」的抱怨,大多都能用它來解釋。
參數(Parameters)
參數是模型在訓練過程中學到的內部數值,也是衡量模型大小的常見指標。
參數以十億為單位計算,參數越多,大致上代表能力越強、成本也越高。但單看參數數字並不是一個好的選購標準,基準測試和你自己的實測,都比參數數字更可靠。
回覆(Response)
回覆是模型針對一則提示詞產生的輸出,有時也叫做completion。
每一次的回覆都是重新產生的,這也是為什麼針對同一則提示詞重新產生一次,措辭會不一樣,有時候答案本身也會不一樣。
跟模型對話
系統提示詞(System prompt)
系統提示詞是模型在收到你的訊息之前,就先拿到的固定指示,用來設定它的角色、語氣和規則。
每一款產品都有系統提示詞,即使你看不到它。當一個聊天機器人「有個性」的時候,通常就是系統提示詞在發揮作用。
提示詞工程(Prompt engineering)
提示詞工程是刻意寫好提示詞,好穩定得到更好輸出結果的做法。
雖然名字聽起來很厲害,但大部分內容其實就是把話講清楚:說明目標、提供背景、給個範例、指名格式。新手指南整理了真正能改變結果的技巧。
零樣本(Zero-shot)
零樣本指的是請模型完成一項任務,卻不給它任何範例。
現代模型能在零樣本的情況下處理大多數日常任務。這個詞之所以還留著,主要是為了跟少樣本提示詞做對比。
少樣本(Few-shot)
少樣本指的是在提示詞裡放進幾個示範範例,讓模型照著模式做。
對格式要求嚴格的工作來說,這是成本最低的可靠度提升方式:兩、三個輸入和期望輸出的範例,效果會勝過一整段文字說明。
思維鏈(Chain of thought)
思維鏈指的是模型在給出最終答案之前,先走過中間的推理步驟。
請模型一步一步推理,在困難的問題上確實能帶來可衡量的改善,而推理模型現在預設就會在內部做某種版本的思維鏈。
溫度(Temperature)
溫度是控制模型在挑選下一個token時,加入多少隨機性的設定。
低溫會得到穩定、保守的輸出;高溫會帶來變化,偶爾也會出現不合理的內容。聊天產品通常會幫你選好一個中間值。
串流(Streaming)
串流指的是模型一邊產生答案,一邊逐個token送出,而不是等全部完成才一次送出。
這就是為什麼答案看起來像是自己在打字,也是為什麼一個不好的答案可以提早喊停,不用等它跑完。
重新產生(Regenerate)
重新產生指的是針對同一則提示詞,再要求一次全新的回覆。
因為產生過程本身帶有機率性,重新產生是真正重新抽一次,而不是把同一次運算再跑一遍。把兩次結果拿來比較,或是把同一則提示詞丟到兩個模型上比較,是一種快速的品質檢查方式。
模型是怎麼做出來的
訓練(Training)
訓練是根據資料不斷調整模型參數,直到它的預測夠準確為止的過程。
這件事在你接觸到這個模型之前就已經完成,而且要花掉供應商龐大的運算資源。你在對話框裡打的任何字,都不會當場重新訓練這個模型,不過供應商可能會依照自己的政策,把對話拿去訓練未來的版本。
訓練資料(Training data)
訓練資料是模型學習所依據的文字和其他素材。
它的廣度,決定了模型知道什麼;它的缺口,解釋了系統性的盲點;而它涵蓋的時間範圍,則決定了訓練截止日。
預訓練(Pretraining)
預訓練是訓練過程裡第一個、也是規模最大的階段,模型在這個階段從大量文字中學會語言和世界知識。
這個階段的成果有能力,但還很粗糙。讓模型表現得像個樂於助人的助理的所有工夫,都是在這之後才做的。
微調(Fine-tuning)
微調是在一個範圍更小的資料集上,對一個已經預訓練過的模型做額外訓練,好讓它變得專精或改變它的表現方式。
供應商為了實用性和安全性做微調;企業則為了特定領域的任務做微調。對大多數使用者來說,寫好提示詞加上一個能力夠強的通用模型,效果會勝過花錢做微調。
RLHF
RLHF,也就是根據人類回饋的強化學習(reinforcement learning from human feedback),是拿人類對模型答案的評分來訓練模型的方法。
這是現代助理表現得有禮貌、有條理、又謹慎的一大原因。做過頭的話,也會讓模型變得愛打太極,出現拒答或含糊其辭的狀況。
對齊(Alignment)
對齊是讓模型的行為,符合人類意圖和價值觀的工作。
實務上,這涵蓋的範圍從拒絕有害的請求,到單純準確地照指示做事都算。當一個模型做出技術上很厲害、卻不是你想要的事情時,那就是一個對齊上的落差。
推論(Inference)
推論是執行一個已經訓練好的模型來產生答案的過程,跟訓練是兩回事。
你送出的每一則訊息都會觸發推論,token計價衡量的正是推論的成本。運算成本低的模型,也可能表現得相當出色;AI模型成本指數顯示,價格差距可以到2,000倍。
Transformer
Transformer是幾乎所有現代語言模型背後,共同採用的神經網路架構。
它的關鍵機制叫做注意力機制(attention),能讓模型把輸入內容的每一部分,拿來跟其他每一部分互相權衡比較。你完全不需要弄懂細節,但這個詞在AI相關文章裡到處都是。
出錯的時候
幻覺(Hallucination)
幻覺是模型用完全篤定的語氣,說出一件不實的事情。
這不是一個下一個版本就會修好的臭蟲,它是這類系統產生內容的方式本身帶來的結果。發生頻率會因模型和任務不同而有很大差異。任何具體的事實、數字或引用來源,在你查核之前都該當成未經驗證。為什麼AI會出錯說明了背後的機制。
落地依據(Grounding)
落地依據指的是給模型提供有憑有據的資料來作答,而不是讓它單靠記憶回答。
貼上合約、附上報告,或是開啟網路搜尋,都屬於提供落地依據。這是日常生活中對抗幻覺最有效的做法。
偏誤(Bias)
偏誤是模型的輸出,因為承襲了訓練資料裡的傾向,而系統性地朝某個方向偏移。
它會表現成對人、地方和預設值的各種假設。碰到重大決策時,審視AI的輸出,要像審視一個聰明但沒經過查核的實習生的作業一樣。
護欄機制(Guardrails)
護欄機制是供應商在模型外圍設下的限制,用來擋掉有害或違反政策的輸出。
不同供應商畫的界線並不一樣,這是產品之間真實存在的差異:同一個請求,可能被一個模型回答,卻被另一個模型拒絕。
越獄(Jailbreak)
越獄是刻意設計來誘騙模型無視自身護欄機制的提示詞。
供應商會持續修補這類漏洞。對一般使用者來說,這個詞的意義主要是一種安全概念:只要有辦法說服模型做某件事,就會有人去試。
紅隊測試(Red teaming)
紅隊測試是在模型正式發布之前,刻意去攻擊它,找出有害的失敗模式。
供應商會安排內部和外部的紅隊,發布出來的模型卡通常會摘要他們的發現。這相當於AI版本的滲透測試。
訓練截止日(Knowledge cutoff)
訓練截止日是模型訓練資料涵蓋範圍結束的那個日期。
問任何比這個日期更新的事,模型要嘛承認自己不知道,要嘛就靠瀏覽網路(如果它有這個功能)來回答,不然就是產生幻覺。知道自己在用的模型的截止日,可以避免一整類的錯誤。
檢索技術和你的資料
RAG(檢索增強生成)
RAG,也就是檢索增強生成(retrieval augmented generation),指的是先找出相關文件,再讓模型根據這些文件作答。
這就是「跟你的知識庫對話」這類產品背後實際運作的方式,也是它們能附上出處的原因。RAG能降低幻覺發生的機率,但答案的品質,仍然取決於它檢索到的內容好不好。
嵌入向量(Embedding)
嵌入向量是一串用來代表一段文字意義的數字。
意義相近的文字,會得到相近的數字,這讓軟體可以用數學方法找出相關的段落。嵌入向量是語意搜尋和RAG背後的運作機制。
向量資料庫(Vector database)
向量資料庫是專門用來儲存嵌入向量,並快速找出最相近向量的資料庫。
如果一款產品說它把你的文件「建立索引」供AI搜尋使用,那麼每一段文字的嵌入向量,就存放在這種資料庫裡。
語意搜尋(Semantic search)
語意搜尋是靠意義而不是靠關鍵字比對來找出文字的方法。
搜尋「錢的問題」也可能找出一段談現金流吃緊的內容,即使裡面沒有一個字完全相符。這就是嵌入向量派上用場的地方。
分塊(Chunking)
分塊是把長文件切成夠小的片段,好讓系統能有效地建立嵌入向量並檢索。
聽起來像是管線工程,事實上也差不多是,但分塊做得不好,正是文件對話工具答非所問、答錯部分內容的常見原因。
網路搜尋(Web search,AI功能)
AI裡的網路搜尋,指的是模型在作答之前先抓取當下的網頁內容,而不是單靠訓練時的記憶。
這是用速度換取新鮮度的做法,也讓答案能附上你可以點開查看的出處。對任何發生在模型訓練截止日之後的事情來說,這就是「一個真正的答案」和「一個用猜的答案」之間的差別。
知識庫(Knowledge base)
知識庫是企業提供給自家AI,作為回答依據的一套經過整理的文件。
輸入品質決定輸出品質:一個依據過時wiki作答的助理,會很篤定地端出過時的答案,還會附上出處。
這份詞彙表裡有三個術語,分別代表同一個問題的不同答案:怎麼讓模型在你的任務上表現更好。把這三者搞混,是產品會議裡最常見的行話錯誤。並排比較如下:
| 做法 | 改變的是什麼 | 成本與速度 | 什麼時候該用 |
|---|---|---|---|
| 更好的提示詞(零樣本、少樣本) | 只有你送出的文字 | 免費,幾分鐘搞定 | 幾乎永遠是第一步;兩、三個示範範例就能解決大多數格式問題 |
| RAG | 模型在作答前讀到的內容 | 建置成本中等,不需要重新訓練 | 答案必須保持最新,或需要引用你自己的文件時 |
| 微調 | 模型本身的參數 | 慢又貴,做完就固定了 | 大規模、穩定的風格和格式需求,個人幾乎用不到 |
文字之外
多模態(Multimodal)
多模態指的是一個模型能同時處理不只一種媒介,例如文字加上圖片、音訊或影片。
這就是為什麼你可以截一張錯誤訊息的圖,然後問這是怎麼回事。多模態AI指南整理了目前真正好用的功能。
視覺模型(Vision model)
視覺模型是能理解圖片的模型:照片、截圖、圖表和文件都算。
看懂圖片跟畫出圖片是兩回事,一個模型可能可以完美描述你的圖表,卻還是畫不出一張圖表。
圖片生成(Image generation)
圖片生成是根據文字描述,產生出全新圖片的過程。
不同生成工具之間,畫質、風格範圍,以及圖片裡文字的呈現效果,差異都很大,這也是為什麼認真的使用者會拿好幾款來比較。圖片生成工具總覽持續追蹤這個領域的最新狀況。
擴散模型(Diffusion model)
擴散模型從一堆雜訊開始,一步一步地朝著文字描述修正,最後生成圖片。
這是現代圖片生成工具背後的主流技術。知道這個詞,主要的用處是:當產品名稱裡出現「diffusion」時,你就知道這款產品在做什麼。
語音轉文字(Speech to text)
語音轉文字是把說出來的聲音,轉成寫下來的文字。
現代的轉錄準確度已經夠高,能讓會議、語音筆記和訪談內容變得可以搜尋,這也是聊天應用程式裡語音輸入功能運作的方式。
文字轉語音(Text to speech)
文字轉語音是把寫下來的文字,轉成說出來的聲音。
現在的系統能產生自然、富有表現力的聲音,這也是朗讀功能和AI語音對話背後的技術。
更大的生態系統
API
API是開發者用來從自己的軟體,把提示詞送進模型的程式化入口。
API的計價方式是按token計算,每一個AI產品背後每則答案的成本結構,最終都是從這裡來的。
開放權重(Open weights)
開放權重指的是模型訓練好的參數被公開出來,任何人都可以下載並執行。
這讓自架成為可能,也讓其他供應商能在自己的基礎設施上提供這個模型的服務。DeepSeek和Llama是最知名的例子。
開源模型(Open-source model)
開源模型大致上是指釋出供大眾使用和修改的模型,不過各家授權條款差異很大。
實際上該問的問題永遠是同樣兩個:能不能商業使用,還有由誰幫你架設。當隱私或成本考量,讓你沒辦法選用託管的旗艦模型時,開放權重生態系就特別重要。
基準測試(Benchmark)
基準測試是用來替模型評分、互相比較的標準化測試。
用來做初步篩選很有用,但在行銷裡經常被過度渲染。一個在基準測試上名列前茅的模型,在你實際的工作上還是可能表現不佳,這也是為什麼自己拿三項任務來實測,會比看排行榜更可靠。
代理(Agent)
代理是一種會分好幾個步驟採取行動、朝目標前進的AI系統,而不只是回答一次就結束。
訂位、研究、寫程式、送出工單,都是代理的活動範圍。這項能力是真實存在的,而且進步得很快;跟著一起變重要的,還有在事情產生影響之前,先審視代理做了什麼的必要性。
工具使用(Tool use)
工具使用,也叫做function calling,指的是模型呼叫外部功能,像是搜尋、計算機、程式碼,或是你的行事曆。
這是聊天助理能對現實世界採取行動、而不只是描述現實世界的方式,也是代理背後的運作機制。
推理模型(Reasoning model)
推理模型是一種會在內部多花一些運算資源,把問題想清楚之後才回答的模型。
這是拿時間和成本,去換取困難問題上的準確度。對簡單的問題來說,多想這一步幾乎沒有幫助,這也是依任務切換模型的另一個理由。
延遲(Latency)
延遲是從你送出提示詞,到答案抵達或開始串流出現之間,要等多久。
延遲會因模型大小、系統負載,還有這是不是一個推理模型而有所不同。對需要即時互動的工作來說,一個夠快、夠好用的模型,往往勝過一個又慢又厲害的模型。
速率限制(Rate limit)
速率限制是供應商對你在一段時間內能使用多少次請求或多少token所設下的上限。
碰到速率限制,通常就是聊天產品叫你等一下或升級方案的原因。訂閱方案上的訊息額度上限,其實就是換了個比較好聽的說法的速率限制。
讓這份詞彙表保持有用
這個領域裡的術語汰換得很快。這個頁面是當作參考資料在維護的:當用法改變時,條目就會被重寫,而連結出去的深入指南,則承載了放不進一則定義裡的細節。
如果你在其他地方碰到一個這裡沒收錄的詞,最快的做法是把你看到那句話的整段句子,貼給一個能力夠強的模型,請它根據上下文解釋這個詞的意思。在Whizi裡,你可以同時問兩個模型,觀察它們什麼時候意見不一致,而對新出現的行話來說,這種情況其實出乎意料地常見。
- 先引用那句話的定義;但在真正依賴它之前,記得把細節也讀過
- 當兩個來源對同一個詞的定義不一樣時,在AI領域裡,通常是比較新的用法勝出
- 先學會token、上下文視窗和幻覺這三個詞;其他大多數術語,都是圍繞著這三個展開的
- 對於任何你不熟悉的模型相關說法,都拿自己的三項任務實測來驗證
- 如果這個頁面讓你覺得像一本參考手冊,先去用新手版詞彙表,因為這頁本來就是一本參考手冊
常見問題
AI、機器學習和LLM之間有什麼差別?
AI是一個廣義的目標,指軟體去執行需要人類判斷力的任務。機器學習是用範例來教會軟體的技術,現代幾乎所有的AI,都是用這種技術打造出來的。LLM則是機器學習模型的其中一種,用文字訓練而成,也就是ChatGPT、Claude和Gemini背後那一類模型。
AI裡的RAG是什麼意思?
RAG是檢索增強生成(retrieval augmented generation)的縮寫:系統會先找出相關文件,再讓模型根據這些文件作答,而不是單靠記憶回答。這是「跟你的檔案或知識庫對話」這類產品背後的標準技術,也是這些產品能附上出處的原因。
微調和RAG有什麼差別?
微調是用額外的訓練,去改變模型本身,這個過程慢,而且結果固定下來就不會變。RAG則不動模型,而是在提問的當下,把對的文件交給它,這樣做起來更有彈性,內容也能保持最新。如果你想讓一個助理跟得上不斷變動的資訊,RAG幾乎永遠是對的工具;微調則比較適合穩定不變的風格和格式需求。
AI裡的token是什麼?
token是模型讀取和寫出文字時所用的單位,大約是四分之三個英文單字。所有東西都是用token計算的:價格、速度,還有上下文視窗。一份1,000字的文件,大約是1,300個token。
這些術語,我真的都需要知道嗎?
日常使用大概只需要五個:模型、提示詞、token、上下文視窗和幻覺。這份詞彙表的新手版,會用更有耐心的方式講解這幾個詞。這個頁面其餘的部分,是為了某天一個產品頁面或一篇文章,突然丟出一個你沒見過的詞時準備的。