AI 是什麼?它和 LLM 有什麼關係?
想像一個吃豆人式的迷宮:角色由程式控制,目標是走到一顆豆子的位置。你堵住原本的路,它又找到另一條路。看起來,它好像知道自己該往哪裡走。
這種「會自己找路」的行為,是怎麼做出來的? 我們先拆開一個小例子,再看看人工智慧 (Artificial Intelligence, AI) 還能用哪些方式建立能力。
角色怎麼知道要往哪裡走?
先把迷宮縮小成五個地點。S 是角色的起點,G 是豆子的位置;地點之間的線,代表可以走的通道。
| 提供給程式的資訊 | 在例子中代表什麼 |
|---|---|
| 地圖 | 哪些地點相連、哪些通道可走 |
| 起點 S | 角色現在在哪裡 |
| 目標 G | 要走到哪裡 |
| 找路規則 | 怎麼依序檢查可以到達的地點 |
程式可以從 S 開始,先檢查走一步能到哪裡,再檢查走兩步能到哪裡,逐層往外找。把已檢查過的地點記住,就不會一直繞著同一段路打轉。
這種探索可能路線的做法叫搜尋 (Search)。本例採用廣度優先搜尋 (Breadth-First Search, BFS):從少步數到多步數找。每一段的成本都相同時,它能找出段數最少的路。
地圖有兩條候選路線:S → A → G 是 2 段,S → B → C → G 是 3 段。如果封閉 A–G,角色還能走到豆子的位置嗎?
先看全部開放時的路線,再封閉 A–G。用「下一步」比較程式檢查的位置與最後路線;接著連 C–G 也封閉,看是否還能到達目標。
看起來會變通,背後改了什麼?
| 路況 | 程式算出的路線 | 角色可以怎麼走 |
|---|---|---|
| 全部開放 | S → A → G,2 段 | 走上方的短路 |
| 只封 A–G | S → B → C → G,3 段 | 繞到下方,仍然到達 G |
| A–G、C–G 都封閉 | 找不到路 | 無法沿現有通道到達 G |
在練習中,「搜尋」面板的表格記錄程式檢查了哪些位置,「結果」面板才列出最後選定的路線。程式檢查過的位置,不等於角色最後都要走過的位置。 搜尋先探索選擇,再交出一條可以執行的路。
從外面看,角色好像會因應封路而改變主意;拆開來看,它是用同一套找路規則,處理這次不同的地圖。這次換的是地圖,找路規則本身沒有改變。
這能讓我們先分清楚兩件事:你看到它做了什麼,以及程式怎麼把這個行為做出來。 知道內部使用演算法 (Algorithm),也不代表這個能力就失去價值;我們要理解的正是計算如何形成行為。
AI 想讓電腦做到什麼?
人工智慧 (Artificial Intelligence, AI) 是一個研究與技術領域,關注如何讓電腦完成辨識、學習、推理與規劃等任務。會找路、辨認照片與處理語言,是不同的能力;聊天只是其中一種應用。
先看幾個你可能見過的例子:
| 能力 | 電腦收到什麼 | 要得到什麼 |
|---|---|---|
| 辨認照片內容 | 一張照片 | 判斷照片裡有沒有貓 |
| 語音辨識 (Speech Recognition) | 一段錄音 | 對應的文字 |
| 預測需求量 | 過去需求等資料 | 未來需求的估計數值 |
| 生成內容 | 要求與相關資訊 | 新的文字、圖片或聲音 |
這些例子說的是要完成什麼任務,不是四種互不相容的 AI。完成它們的做法可以不同,同一套系統也可以結合多種能力。
其中,以產生新內容為目標的方向稱為生成式 AI (Generative AI)。所以生成式 AI 不只包含聊天,也不只包含文字;照片辨識這類判斷任務,則不需要生成一段新內容。
所有 AI 都是這樣寫規則嗎?
剛才的找路例子,人能寫清楚哪些位置相連、如何檢查下一個位置。換成「照片裡有沒有貓」,情況就不同了。你很容易認出貓,但要把所有判斷規則寫成程式就很難:貓可能側身、縮成一團、只露出半張臉,毛色與光線也不同。
另一種做法,是先設計一套接收照片、計算並輸出判斷的數學結構,稱為模型 (Model)。
接著準備許多照片,標明哪些有貓、哪些沒有貓,讓模型先做判斷,再根據判斷與標記的差距,反覆調整內部的數值。這個過程叫訓練 (Training);這種從資料學習的方法,叫機器學習 (Machine Learning)。
人不必逐條寫出所有辨認規則,而是設計模型與學習方法,讓資料參與形成它的判斷方式。
| 階段 | 提供什麼 | 模型做什麼 |
|---|---|---|
| 訓練時 | 許多照片,以及有貓/沒有貓的標記 | 做判斷、比較標記、調整內部數值 |
| 使用時 | 一張要辨認的新照片 | 用已形成的計算方式,判斷是否有貓 |
使用已訓練的模型計算結果,叫推論 (Inference)。它的目標不只是答對練習過的照片,也要能處理沒看過的新照片;能不能做到,需要另外檢查,不能因為完成訓練就當作一定可靠。
找路例子展示依規則探索選擇,照片例子展示從資料形成判斷方式。這些是解釋能力怎麼做出來的案例,不是 AI 的兩個完整分類。 系統也能把學到的模型與搜尋搭配使用。
接著沿著機器學習往下看,認識其中處理語言的一類做法。並非所有機器學習都有人逐筆給答案,後續會再介紹其他學習方式。
那麼,LLM 在哪裡?
機器學習有多種做法。其中,神經網路 (Neural Network) 用互相連接的數學運算來處理資料,訓練會調整運算中使用的數值。深度學習 (Deep Learning) 使用多層神經網路,讓資料經過多層處理。
大型語言模型 (Large Language Model, LLM) 是以語言為核心的一類模型。現代 LLM 通常透過深度學習建立,從大量資料中學習規律。常見的生成式 LLM 能依據前文逐步產生文字;後面的章節會解釋它如何計算下一步,以及訓練怎麼改變那些計算。
圖中的框表示包含關係:LLM 是我們深入研究的案例,AI 是更大的領域。 這張圖只畫出走向現代 LLM 的路線,沒有列出所有 AI 方法或所有深度學習模型。
也不能把「生成式 AI」直接換成「LLM」:前者按產生新內容這個任務命名,後者是一類模型。生成圖片的系統不一定使用 LLM,照片辨識模型也不必會聊天。
AI 聊天產品和模型有什麼不同?
你使用 ChatGPT、Gemini 或 Claude 聊天時,操作的是 AI 聊天產品。產品背後的語言模型負責處理輸入與產生輸出。模型負責計算,產品把模型與介面、對話紀錄等部件組合成可以使用的服務。
例如你看到先前的訊息、輸入框與送出按鈕,是在操作產品。文字送出後,模型才處理這次收到的內容並產生輸出。對話紀錄怎麼送進模型、產品如何接上外部資料與工具,後面會另外解釋。
因此,我們會先以文字對話追 LLM 的原理,再介紹其他 AI 任務與應用系統;不用把所有 AI 都套進聊天模型的回答流程。
接著讀〈我傳一句話給 AI,到底發生了什麼?〉,追聊天服務背後的語言模型如何逐步產生回答。搜尋、照片辨識與語言生成都能產生有用的行為,但不能把它們的內部流程混成同一種方法。
參考:Berkeley 的吃豆人搜尋教材、Google 機器學習概覽、Hugging Face 的 NLP 與 LLM 定位、MuZero:學習模型與搜尋的結合、圖靈〈Computing Machinery and Intelligence〉原文(2026-10-01 查核)。