預測文字的模型,怎麼學會照指令回答?
前面看到,大型語言模型 (Large Language Model, LLM) 練習的是:讀前面的文字,預測下一個 Token。可是,我在 ChatGPT、Gemini 或 Claude 輸入「請把這句話縮短」,期待的是完成要求,不是接著幫我寫另一句要求。
同樣是接文字,模型 (Model) 怎麼學會「現在輪到我回答,而且要照前面的要求回答」?
關鍵在於:訓練 (Training) 不只可以拿文章給它接,也可以拿「要求+示範回答」給它練。預測下一個 Token 的工作沒有換掉;換的是練習材料,以及訓練程式拿哪些位置的預測來評分。
先看兩筆材料差在哪裡
沿用前面下雨、帶傘的句子。先只看材料,不算公式:
| 訓練材料 | 讓模型練習接什麼 |
|---|---|
| 一般文章:今天下雨,出門帶傘。 | 看「今天」接「下雨」,再接後面的原文。 |
| 問答示範:使用者說「請縮短:今天下雨,出門時記得帶傘。」;助理回答「下雨帶傘。」 | 看使用者的要求,練習接出助理的示範回答。 |
第二筆多了兩件事:誰在說話,以及要求怎麼回答。模型不是收到一個神祕的「服從開關」,而是在許多不同要求與示範裡,練習這種對應。
這是構造的教材示範。「使用者:/助理:」用來看清角色,不是真實模型通用的對話格式;Token 切分也由教材指定。實際訓練需使用該模型相容的文字整理方式與角色標記。
實際聊天時,常見做法是由聊天程式整理使用者與助理的角色標記,並放上開始回答的標記,再交給模型接續。這些標記也是輸入的一部分;你不用手動輸入本例的「助理:」。
回答第一個 Token 時,模型看見什麼?
要練習回答「下雨帶傘。」時,第一題可以這樣拆:
模型此刻看的是使用者要求和助理開頭,還不能看即將預測的「下雨」。訓練程式持有示範答案,才能檢查模型給「下雨」多少機率 (Probability)。到了下一個位置,前面的示範「下雨」也能作為輸入,目標才換成「帶傘。」。
這和把原文拆成訓練題的原理相同:每個位置只能用允許的前文,目標來自準備好的材料。接著再像一步訓練那樣,根據預測誤差更新權重 (Weights),也就是模型裡學到的數值。
先看「要求縮短」的第一個回答位置,再切到「要求給建議」,比較前文與目標。接著查看要求本身的位置:它沒有納入本例評分,卻仍會出現在回答的前文。這是材料觀察練習,不會訓練真實模型。
「看見要求」和「要求本身要不要計分」是兩回事
這個問答例子只拿助理回答的文字位置來評分。使用者寫的要求仍是模型的輸入,只是這次不要求它練習「把使用者那句話也接出來」。
所以,不納入評分不是刪掉要求,也不是讓模型看不到要求。它仍必須利用要求,才有機會預測出相應的回答。實際訓練也有把整段序列納入評分的做法;本例只選一種,方便看清兩個角色。
換一個要求,為什麼示範也要換?
同樣給「今天下雨,出門時記得帶傘。」,若要求從「請縮短」換成「請給建議」,可以把示範回答改成「出門帶傘。」。
這時第一個回答目標從「下雨」換成「出門」。訓練程式教的並非「看到下雨就永遠輸出同一句」,而是結合目前的要求與內容,預測這筆示範怎麼回答。它需要多樣、品質好的例子,也要用沒參與訓練的題目檢查效果;單看這兩筆不能證明模型已經學會照指令回答。
這在製作 LLM 的哪一步?
| 階段 | 材料與目的 |
|---|---|
| 預訓練 (Pretraining) | 先用大量材料學習文字規律與各種能力。材料本來也可能含問答,並非完全沒有指令範例。 |
| 後訓練 (Post-Training) | 接著調整模型,讓行為更符合預定用途。上面的「要求+示範回答」是其中一種做法。 |
在已訓練模型上,用示範輸入與回答繼續訓練,通常稱為監督式微調 (Supervised Fine-Tuning, SFT)。名字可以先當定位:它仍透過預測、比較與調整數值來學,只是練習材料更直接呈現希望它怎麼回答。
後訓練還可以利用偏好回饋 (Preference Feedback):對同一個要求,比較哪個回答較好,再把這種比較用於調整模型。這與直接提供一則示範答案不同;具體怎麼調整留到後面的章節,不把所有後訓練都當成同一種配方。
我在聊天時給例子,也是在訓練嗎?
一般聊天時,你寫要求或補一個範例,是改變這一次可看的前文。模型用已有的權重產生回答,叫做推論 (Inference);它不等於正在執行本章的權重更新。
模型能照某些指令回答,也不代表它保證服從所有要求、內容一定正確,或真正掌握了示範以外的所有情況。這章回答的是能力如何被訓練塑造,使用時仍要另外檢查結果。
參考:Hugging Face 的對話格式與回答開頭、Hugging Face 的監督式微調概況、SFTTrainer 的目標計算與助理回答評分設定、指令示範與人類偏好訓練的原始研究(2026-10-08 查核)。本章使用構造資料,不重現任何商用產品的完整訓練流程,也不以這些示範測量模型能力。