沒有人逐筆給答案,AI 也能學嗎?
前一章用糖果收據教模型 (Model) 估計總價:算完之後,拿收據上的金額比較,再選擇或調整參數 (Parameter)。如果沒有那個金額,程式要怎麼知道該往哪裡改?
這章接著追問:沒有人工逐筆提供正確答案,學習的依據還能從哪裡來?
答案是可以有其他來源。有人提供答案,只是其中一種做法;也可以從資料本身整理出目標、找資料中的結構,或在操作之後取得回饋。人仍需設計要學什麼,以及怎麼比較。
先看熟悉的收據:有對應答案
交給程式「買 2 顆」,並提供收據記錄的「總價 10 元」。模型估計 8 元時,就可以算出與 10 元的差距。用很多筆這樣的輸入與答案,逐步調整計算方式。
這叫監督式學習 (Supervised Learning)。「監督」不是有人坐在旁邊盯著每一步,而是訓練 (Training) 材料有對應的答案。答案也不一定是人手工填的:收據、儀器量測與既有紀錄都可能提供它。
如果只剩糖果顆數,沒有總價,就無法做剛才那種總價誤差比較。刪掉答案,不會讓同一個訓練程式自動變成別種學習。 要改用其他方法,還得重新決定目標與比較方式。
原文已經有下一個字:從資料整理出答案
現在換成文字,因為文字可以直接示範「沒有另外填答案,仍能取得對照目標」。
假設原文是「各位」。程式可以把這份原文拆成:
| 用途 | 內容 |
|---|---|
| 給模型的前文 | 各 |
| 保留到預測後才比較的目標 | 位 |
模型只拿到「各」來預測,程式再用保留的「位」比較結果。原文若換成「各自」,前文仍是「各」,這筆材料的目標就變成「自」。
目標是從原文取出的,不是模型先猜一個答案,再相信自己的猜測。 從資料本身整理學習目標的做法,叫自監督式學習 (Self-Supervised Learning)。也可以遮住原文的一部分,保留被遮住的內容作比較;具體安排依任務而異。
常見生成式語言模型 (Generative Language Model) 的預訓練 (Pretraining) 就會從文字整理出前文與下一步目標。這裡先按字示意;後面的〈文字為什麼會切成 token?〉再說真實文字的處理單位。
沒有逐筆答案:先找資料的結構
回到糖果。這次目的改成「把相近的糖果分在一起」,不再估計總價。資料只有每顆的尺寸等資訊,沒有預先寫好它屬於哪一類。
人可以先選定比較尺寸的方式,讓分群 (Clustering) 方法把尺寸接近的資料整理成組。這是非監督式學習 (Unsupervised Learning) 的一個例子:找資料中的分組或結構,不用逐筆的正確類別來比較。
沒有類別答案,仍需要指定怎麼看相似。 尺寸接近不表示口味相同;換比較依據,分組也可能不同。分好的組也不會自動得到「草莓味」這種意義,還需要另外解讀。本章只概覽這個分工,不展開分群算法。
操作之後才有回饋:學習怎麼行動
糖果與文字例子都先有一份材料。遊戲則需要角色先做出動作,才能看到結果,所以再換一個情境。
假設遊戲規則是「吃到金幣 +1 分,碰到敵人 −1 分」。角色移動後,環境回傳得分;並沒有事先給每個畫面一個正確按鍵。
這種透過操作與回饋學習行動方式的方向,叫強化學習 (Reinforcement Learning);用來引導學習的回饋叫獎勵 (Reward)。學習要考慮一連串動作帶來的累積回饋,不只是每次都選眼前得分最高的動作。
人仍需設計環境、可做的動作與獎勵。規則設得不合適,學到的行為也可能偏離原本目的。活動只顯示一次事件如何產生回饋,不執行行動策略 (Policy) 的訓練。
這和導論的迷宮搜尋有差別:照既定規則搜尋一條路,不需要先靠獎勵學習。外表都會移動,不代表內部用了同一種方法。
把四種依據放回同一張圖
| 做法 | 用什麼作依據? | 本章例子 |
|---|---|---|
| 監督式 | 輸入對應的已知答案 | 顆數與收據總價 |
| 自監督式 | 從原始資料整理出的目標 | 前文「各」與原文下一字 |
| 非監督式 | 資料結構與指定的比較目標 | 按尺寸找相近的糖果 |
| 強化 | 操作後得到的獎勵與累積回饋 | 吃金幣或碰敵人的得分 |
這是理解依據來源的對照,不是四個互斥、涵蓋一切的 AI 分類。自監督式常被放在更廣的非監督式範圍討論;本章分開介紹,是為了讓你看見「從資料製作預測目標」這一步。
同一個系統可以先從大量原文學習,再用示範答案調整,之後視需求加入其他回饋。生成式 AI (Generative AI) 說的是產生新內容這種用途,也不是第五種互斥的學習依據。
沒有人工逐筆答案,不等於沒有目標、沒有比較,也不等於不用人設計。 先弄清楚依據從哪裡來,再問參數怎麼調整,就能把不同學習方式和後面的計算細節接起來。
接著讀〈神經網路與深度學習,是怎麼算的?〉,看模型內部的數值如何參與計算。語言模型整理目標與更新參數的細節,可再讀〈預測錯後,參數與機率如何改變?〉。
先猜猜:換收據金額、原文下一個字、糖果尺寸或遊戲事件,哪一份比較依據會改變?切換四個案例,追材料與依據的關係。
參考:Google 的監督式學習說明、Hugging Face 從原文建立語言模型目標、Google 的分群與相似依據、Hugging Face 強化學習與環境回饋。2026-10-05 查核;各段採代表性例子,不主張所有模型用相同配方。