AI 的能力怎麼來,又怎麼變成可以使用的服務?
上一篇用找路與照片辨識,介紹人工智慧 (Artificial Intelligence, AI) 的範圍。接著很容易想問:這些能力是怎麼做出來的?做好之後,我又是怎麼用到它的?
先把整套流程看清楚,再深入各個零件。這章沿用「辨認照片裡有沒有貓」,接著把同樣的分工帶到聊天服務。你暫時不需要懂公式或程式。
先分開:建立能力,和使用能力
前一章的找路例子,由人寫好探索路線的規則。照片辨識則示範另一條路:讓資料參與形成判斷方式,這叫機器學習 (Machine Learning)。它是許多現代 AI 的基礎,但不是全部 AI 的通用做法。
這條路有兩個階段:
模型 (Model) 是負責接收資料、計算結果的部分。例如收到一張照片,算出「有貓」或「沒有貓」的判斷。訓練 (Training) 是建立或調整這個計算能力的過程;推論 (Inference) 則是使用已有模型處理這次輸入。
不是每辨認一張照片,就重新建立一個模型。 同一個模型可以接著處理另一張照片;換輸入和重新訓練,是兩件不同的事。
如果想做出辨認貓的 AI,大致要做什麼?
先決定要檢查「有沒有貓」,再準備照片,標明哪些有貓、哪些沒有貓。人還要選定模型的計算結構,寫好訓練程式,指定如何比較判斷和標記的差距。
訓練程式讓模型反覆做判斷、比較標記,再調整模型內部的數值。完成後,把模型保存起來,使用時再載入。
| 環節 | 在照片例子中做什麼? |
|---|---|
| 準備 | 決定任務,整理照片與標記,另外保留照片做檢查 |
| 訓練 | 根據照片與標記調整模型 |
| 檢查 | 用沒有拿來調整模型的照片,確認能否處理新例子 |
| 使用 | 載入模型,交給它這次要辨認的照片 |
這裡的「學會」有具體意思:模型的計算方式經資料調整,能不能處理新例子,還要用結果檢查。 完成訓練,不等於什麼照片都能答對。
做應用的人也可以直接使用別人已訓練的模型,接上自己的程式。建立模型和使用現成模型,所需的工作不同。
聊天的 AI,也有這兩個階段嗎?
有。ChatGPT、Gemini、Claude 這類聊天服務,背後使用以語言為核心的模型。大型語言模型 (Large Language Model, LLM) 是其中一類;「大」涉及模型內部可調數值、訓練資料與計算的規模,沒有一個適用所有情況的單一門檻。
先看常見生成式 LLM 的概況:
| 階段 | 大致流程 |
|---|---|
| 建立 | 整理大量文字等資料 → 反覆練習預測文字並調整模型 → 檢查表現,依需求進一步訓練 → 保存模型 |
| 使用 | 這次提供的內容 → 已有模型逐步產生文字 → 回答 |
文字本身就可以提供練習材料:把前面的內容交給模型,用原文後面實際出現的內容檢查預測。不需要人為每一句原文另外編一份答案。後續也可以用示範回答或偏好回饋,調整模型回應指令的方式。
使用時,常見生成式語言模型會依據目前提供的內容,產生下一小段文字,再接著產生,直到停止。這個模型負責生成回答,並不是每次都從訓練資料中查出一段原封不動的答案。
先知道這些步驟在做什麼即可。文字怎麼變成數字、下一段怎麼選、訓練究竟改了什麼,後面的章節再分別拆開。
那我使用的服務,就只是一個模型嗎?
你看到的聊天介面,是完整產品的一部分。服務程式還會收集問題、整理對話、呼叫模型,再把結果顯示給你。依產品的設計,它也可以查找文件或執行工具。
例如,你問一個公司內部助理:「公司明天幾點上班?」這是該公司的具體規定,不能只因模型很會寫文字,就假定它知道。
系統可以先找公司文件,再把相關段落和問題一起交給模型:
這種把查到的資料交給模型協助回答的做法,叫檢索增強生成 (Retrieval-Augmented Generation, RAG)。查文件、整理輸入和顯示來源,是系統中的工作;模型負責根據收到的內容產生回答。 加入這次的文件,不等於重新訓練模型。
工具也有類似分工。例如需要算一筆總額時,服務可以讓程式執行計算,再把結果交回模型說明。實際執行計算的是工具程式。
文件有沒有找對、模型有沒有正確使用它、工具有沒有成功執行,都會影響最後結果。有文件或工具,也不保證回答一定正確。
這是固定案例的流程示意。先切換「建立辨識能力」和「辨認新照片」,看訓練與使用的分工。再選「依文件回答」,比較有文件、沒有文件時,交給模型的內容差在哪裡。點每一步查看收到什麼、做什麼、交出什麼。
把剛才的零件放回整張圖
| 部分 | 負責什麼? |
|---|---|
| 資料 | 提供訓練、檢查或這次使用的材料;三者用途不同 |
| 訓練程式 | 根據資料調整模型 |
| 模型 | 使用目前的計算能力處理輸入,交出判斷或生成內容 |
| 服務程式 | 整理輸入、呼叫模型,依需求接文件和工具 |
| 介面 | 讓人提出問題、提供資料、看到結果 |
所以,接下來看到某個細節時,可以先問:它是在建立模型、使用模型,還是在把模型組成服務? 知道它在整張圖中的位置,再追裡面的計算會比較有方向。
- 想知道從資料學習究竟改了什麼:讀〈模型到底是什麼?從資料學習,究竟改了什麼?〉。
- 想先追一次聊天的完整生成過程:讀〈我傳一句話給 AI,到底發生了什麼?〉。
- 想看模型裡的計算怎麼串起來:讀〈神經網路到底在算什麼?〉。
檢索、工具與應用的做法,後續會在應用路線展開。這章先建立分工地圖。
參考:Google 機器學習概覽、Google 訓練與測試資料的分工、Hugging Face 語言模型的訓練與使用、Hugging Face RAG 文件(2026-10-04 查核)。照片辨識與公司上班時間案例為教學設計,活動顯示固定案例的資料流,不執行真實模型。