語言模型 (Language Model) 是什麼,LLM 的「大」是指什麼?
前一章把 AI 系統拆成資料、模型 (Model) 與服務。接著先認清其中一個常見部件:我們說「聊天產品背後有一個 LLM」時,這個 LLM 到底是什麼?它為什麼可以接文字、做摘要,也能用來回答問題?
這章先看它的工作與位置。只需知道模型是接收輸入、計算輸出的系統;內部數值怎麼運算,留到後面的章節。
先從「這段文字接下來可能是什麼」開始
看這段還沒寫完的提醒:「今天下雨,出門記得帶」。接下來可能是「傘」,也可能接出其他內容。
語言模型 (Language Model, LM) 學習文字之間的規律,用來估計一段文字中,哪些內容比較可能出現。常見的生成式語言模型會根據已有文字,一步一步產生後面的內容。
模型不是先看到整份標準答案,再把它搬到畫面上。它使用訓練 (Training) 時調整好的內部數值,處理本次輸入並計算後續內容。這些數值不是人逐句寫好的「問題與答案清單」。
這是常見生成式模型的入門路線;語言模型也有預測文字中被遮住內容等其他形式,不是全部都以相同方式向後接文字。
接文字,怎麼變成摘要或回答?
文字不只有文章正文,也可以包含要求、範例或問題。對已具備相應能力的模型,把這些內容一起交給它,生成的文字就可能成為不同任務的結果。
沿用同一份材料:「今天下雨,出門記得帶傘。」
| 本次交給模型的內容 | 想得到的結果 |
|---|---|
| 還沒寫完的「今天下雨,出門記得帶」 | 接續後面的文字,例如「傘。」 |
| 「請用短句摘要」加上完整材料 | 一句較短的提醒 |
| 完整材料加上「依這段提醒,出門要準備什麼?」 | 根據材料回答問題 |
任務變了,但都可以透過「提供文字 → 生成文字」完成。 這不表示模型只要會接一句話,就自然能把每個任務做好。訓練材料、訓練目標與後續調整會影響它的能力,結果仍需檢查。
也不是所有處理文字的模型都是語言模型。例如,一個只把信件分成「垃圾信/正常信」的分類模型 (Classification Model),不一定在預測文字如何接續。反過來,LLM 也可以被用來做分類;任務名稱與模型種類是兩件事。
LLM 的「大」,大在哪裡?
大型語言模型 (Large Language Model, LLM) 是規模很大的語言模型。現代 LLM 通常使用深度學習 (Deep Learning),也就是用多層神經網路 (Neural Network) 建立計算;它是 AI 中的一類模型,不是 AI 的全部。
最常用來描述模型規模的,是參數 (Parameter) 的數量。參數就是放在模型計算裡、可以透過訓練調整的數值。模型中有多少個這樣的數值,和一篇回答寫幾個字,是不同的量。
| 說法 | 在數什麼? |
|---|---|
| 參數數量 | 模型內可調整的數值有多少個 |
| 訓練資料量 | 用來學習的材料有多少 |
| 訓練計算量 | 為了調整模型,執行了多少計算 |
| 本次輸入長度 | 這一次提供多少內容;不會因輸入變長就增加模型參數 |
例如在參數數量的標示中,B 是 billion(十億):7B 表示約 70 億個參數,70B 表示約 700 億個。這是數量的讀法,不是模型能力的分數,也不是參數值本身。
「大型」沒有一個所有情境通用的固定門檻。參數規模是常見指標;大量資料與計算也是建立這類模型的重要條件,不能把三種規模當成同一個數字。
更多參數代表要保存更多數值;使用相同數值儲存格式時,權重 (Weight) 所需空間會增加。但更大不保證每一個任務都更好:資料品質、計算結構、訓練方式與任務需求都會影響表現。先知道這些量各指什麼,再談具體模型的取捨。
聊天產品,還多了哪些部分?
使用 ChatGPT、Gemini 或 Claude 的聊天介面時,你接觸的是一個產品。背後的語言模型負責計算輸出;產品程式還要接收訊息、整理要交給模型的內容,並把回應顯示出來。這些名稱有時也用於模型系列,討論時要辨認是在談產品,還是某個模型版本。
例如使用者只問「出門要準備什麼?」時,產品程式可以把一份已選好的提醒也加入輸入。模型收到的便是「提醒加上問題」,不只畫面上那一句問話。
產品也可能加入對話紀錄、文件或工具結果。哪些資料被提供、哪些外部動作由程式執行,需要看實際產品安排,不能只由回應文字猜測。
這裡先分清兩層:模型用收到的內容計算;產品決定如何取得、提供與呈現這些內容。 使用時的計算稱為推論 (Inference)。更換本次提供的材料,和重新訓練、更新模型參數不同。
先看「接續文字」,再切到「整理摘要」與「聊天問答」:真正交給模型的文字多了什麼?把下雨提醒換成晴天提醒,比較輸入與案例結果;聊天案例再多看產品如何整理材料。手機可在案例、模型、產品三個面板間切換。
接下來:這個模型怎麼做出來?
現在可以把整體位置接起來:LLM 是一類語言模型,常見生成式 LLM 根據收到的文字產生後續文字;聊天產品把這個計算部件和其他程式組合成可使用的服務。
接著讀〈大量文字,怎麼變成一個可以使用的 LLM?〉,看資料、訓練與程式如何留下可保存、可載入的模型。若要追一次回答的內部流程,讀〈我傳一句話給 AI,到底發生了什麼?〉。
參考:Google 語言模型與 LLM 詞彙定義、Google 參數定義、Hugging Face 語言任務與 LLM、Hugging Face 語言模型的訓練與使用(2026-10-04 查核)。