從 AI 撰寫文案、一鍵去背、人像辨識與生成圖片,AI 究竟是怎麼被打造出來的?
2025 年,你可能每天都在用 ChatGPT、Copilot、Gemini 搜尋資料或撰寫文案,甚至用 Stable Diffusion 或 Midjourney 生圖,但這些「會聊天、會畫畫」的 AI 背後,究竟是怎麼被打造出來?
無論你是否感興趣,理解它們的誕生過程與 AI 背後的運作邏輯,能幫你了解「AI 為什麼會這樣回答你問題,我又該怎麼與它更精準的溝通」的底層邏輯。
目錄
AI 發展歷史
1950 年代|首次提出人工智慧 (Artificial Intelligence)
1956 年,一群學者在美國達特茅斯學院 (Dartmouth College) 的一場會議中,首次提出了人工智慧 Artificial Intelligence 這個新概念。當時 AI 的運作方式非常直觀: 研究人員必須手動設定一條條明確的規則 (聽起來有點像 Excel),像是「如果體溫超過 38°C,就判斷這個人有發燒症狀」。這種方法後來被稱為「符號式 AI Symbolic AI」。
流程簡單來說就是:
- 人工撰寫清楚的規則 → 電腦逐一比對這些條件 → 根據規則給出結論
簡單比喻:
好比爸媽跟小孩說:「看到紅燈就要停下來,看到綠燈才可以走。」孩子只要遇到類似情況就遵守規則即可。

1980 年代|Expert System (專家系統)
到了 1980 年代,AI 技術進一步發展,出現了所謂的「專家系統 (Expert System)」。這種系統延續早期符號式 AI 的規則邏輯,但結構上更加系統化。研究人員會先收集特定領域,例如醫療的專家知識,整理成一個大型的知識庫 (Knowledge Base),再透過「推理引擎 (Inference Engine)」自動進行邏輯推理。
所謂的推理引擎,可以想像成一個專門進行邏輯判斷的程式,能夠自動比對多條規則,從已知的資訊推論出新的結論,以當時知名的醫療診斷系統 MYCIN 為例:
- 規則 A:「如果體溫 > 38°C,則判定為發燒。」
- 規則 B:「如果出現咳嗽 + 發燒 + 喉嚨痛,則可能為細菌感染。」
這樣的系統優點在於邏輯清晰、推論過程容易追蹤,但也有明顯的限制: 所有規則都需由專家手動輸入,當規則數量變多時,維護管理難度就會急劇增加;加上當時電腦效能有限,因此這類系統最終未能普及。
我們也可以把早期的符號式 AI (Symbolic AI) 想成是 Excel 裡單一儲存格的 IF 函數。
例如:=IF(體溫>38, "發燒", "正常")
這代表你寫了一條明確規則,當輸入條件符合,就回傳結果。不過如果你想判斷更多條件,就得一條條額外寫出來。整個系統靠的是「人自己寫邏輯」,而且無法互相串聯。
專家系統 (Expert System) 的出現,就像你開始在 Excel 裡建立一整張串接邏輯的試算表。你不只寫單一函數,而是把很多函數的邏輯規則串起來。
舉例來說:
- A1:
=IF(體溫>38, "發燒", "正常") - B1:
=IF(AND(咳嗽="是", A1="發燒", 喉嚨痛="是"), "可能是細菌感染", "其他")
這就像是 MYCIN 裡的推理引擎:先用一條規則得出中間結論(是否發燒),再根據這個中間結論串接下一條規則來推論出診斷結果。
與前代差異:
從早期單純條列規則的方式,進化到「建立知識庫 + 自動推理引擎」的系統化處理,但本質上仍屬於人工規則導向,尚未具備自動學習能力。
2012|AlexNet + Deep Learning
2012 年,AI 發展出現了重大的轉折點。來自加拿大多倫多大學的研究團隊,推出名為 AlexNet 的新型 AI 模型,首次使用了一種稱為「深度學習 (Deep Learning)」的技術。

深度學習的概念是模仿人類大腦的神經網路,讓電腦能夠透過大量的資料自行「學習」,不再需要人類寫出一條條的規則。當時,AlexNet 模型利用 GPU (圖形處理器,一次能快速處理大量的運算),在超過一百萬張被標記好的圖片上進行訓練,從圖片中自動學習並辨識出不同物體的特徵,例如貓的耳朵形狀、狗的鼻子特徵等等。這個做法在 ImageNet大規模視覺辨識挑戰賽中表現遠勝過傳統方法,直接推動了深度學習時代的來臨。
早期的符號式 AI 和專家系統就像 Excel 裡的函數,每一個判斷都是人寫的公式,規則變多時就會變得複雜。但 AlexNet 和深度學習的方式,更像你給 AI 看了大量標記好的照片,例如告訴它「這些都是貓、那些都是狗」,之後 AI 就會自己學會判斷貓跟狗的差別,完全不需要你再手動寫任何一條「IF 函數」。
AlexNet 在 ImageNet 圖片辨識比賽中的表現遠勝過傳統的規則導向方法,從此開啟了深度學習全面流行的時代。
與前代差異:
從必須人為撰寫規則的時代,正式轉變為由 AI 自行從大量資料中「學習特徵」,大幅降低人類的負擔與限制,也讓 AI 能處理更複雜的任務。
2017|Google Transformer 架構
2017 年,Google 提出了名為「Transformer」的 AI 架構,徹底改變了 AI 理解語言的方式。
以往 AI 在理解一句話時,必須從頭逐字逐詞往後讀,這種方式不僅效率差,對較長的句子也容易遺漏重要資訊。Transformer 則使用了一種稱為「自注意力機制 (Self-Attention)」的關鍵技術,讓 AI 能同時看整個句子,一次分析所有詞元 (token) 之間的關係。
舉例來說,英文句子 “I use AI” 可拆解為三個詞元(token):
- Token 1: “I”
- Token 2: “use”
- Token 3: “AI”
AI 會將句子分解成這樣的小單位,是為了更有效地處理與分析每個詞之間的關聯,例如能快速辨識出「use」描述了「I」與「AI」之間的關係,而無需逐字累積資訊。透過同時評估每一對 token 之間的重要程度(例如 “use” 這個動詞同時與主詞 “I” 和受詞 “AI” 有高度關聯),AI 就能更迅速、更有效地抓住句子的重點、理解完整的語意脈絡。(感覺真像是在上英文文法課😂)
Google 最早將 Transformer 應用於 Google 翻譯,迅速提升了翻譯的品質和準確性,隨後也成為 GPT、Gemini、Claude 等各種大型語言模型的基礎架構,能夠更快速理解與生成符合人類語感的句子。
與前代差異:
傳統語言模型像是在走迷宮,必須一格一格慢慢推進來逐字處理,Transformer 則像是俯瞰整個地圖,直接看到所有路徑與關聯。這種分析方式,大幅提升了語言理解的速度與準確度,也為後來大型語言模型奠定了關鍵基礎。
2022|ChatGPT × RLHF 人類反饋強化學習
2022 年,OpenAI 推出的 ChatGPT 徹底掀起全球對 AI 的熱潮。它建立在 Transformer 架構與大型語言模型 GPT 上,但真正讓它脫穎而出的關鍵,是加入了「人類反饋強化學習(RLHF,Reinforcement Learning with Human Feedback)」的訓練機制,讓回答不僅正確,還更貼近人性。
RLHF 的訓練流程大致可分為三個階段:

預訓練(Pretraining)
AI 首先閱讀大量文本,學習語言結構與知識脈絡,打下理解與生成文字的基礎。
監督式微調(Supervised Fine-tuning)
接著由真人作為標註者提供許多高品質的問答範例,教 AI 如何在不同情境下給出合適、有邏輯的回應。
人類回饋強化學習(RLHF)
在這個關鍵階段,AI 每次會生成多個回答版本,由真人進行排序或評分,接著再透過強化學習機制,反覆調整模型參數,讓未來的回答更接近人類喜好的風格。
範例:
使用者提問:「冰箱有蛋、牛奶和吐司,我可以做什麼?」
AI 產出三個回答版本:
- 回答 A:「你可以吃吐司。」
- 回答 B:「建議你做法式吐司。」
- 回答 C:「你可以用蛋、牛奶和吐司做一份簡單的法式吐司,只要把蛋和牛奶攪拌後浸泡吐司,再用平底鍋煎到金黃就完成了!」
真人評審排序依據:
- 回答 C(具體做法、語氣親切) → 排名第 1
- 回答 B(方向正確但不夠完整) → 排名第 2
- 回答 A(過於簡略、缺乏價值) → 排名第 3
這個排序會用來訓練獎勵模型,AI 接下來在遇到類似提問時,就會更傾向給出具體步驟 + 親切語氣的實用回覆。
與前代差異:
ChatGPT 成功的原因,除了眾所周知的 GPT 語言模型,更重要的是加入了人類反饋強化學習 (RLHF) 的技術。這個方法讓 AI 不只學會語法與邏輯,更進一步學習到人類偏好的回應方式,使得回答更自然且貼近人性。同時,Chat GPT 簡單易用的聊天介面也降低了使用門檻,讓不懂程式技術的用戶也能輕鬆與 AI 互動,迅速在全球掀起熱潮。

AI 是怎麼訓練出來的?
我們用最簡單的方式來總解 AI 是怎麼被訓練出來的。
讓我們用圖像識別來說明:假設你要訓練一個 AI 來分辨貓和狗。

你會先準備好大量圖片,這些圖片會分成三種,就 AI 訓練領域通常會有三種數據:
- 訓練集: 給 AI 看大量標記好的圖片(這是貓、那是狗),讓它學習「貓狗的特徵差異」,這些數據就是訓練集。
- 驗證集: 準備另一批 AI 沒看過的圖片,檢查它能否正確判斷 → 若表現不好,就再微調模型參數,而這些沒看過的資料就稱之為驗證集。
- 測試集: 最後使用全新資料,也就是 AI 沒看過的圖片,這些數據就是測試集,驗證這個模型是否具有「泛化能力」,也就是未來遇到陌生圖片時,是否仍能正確分類。
用大家最常舉例的,AI 學習過程就像學生上課一樣:
訓練集就像是上課時老師教的教材,讓 AI 看大量標記好的圖片學會分辨貓和狗,驗證集像是課後練習,用新圖片檢查學得如何,表現不好就再微調 (小學好痛苦的訂正作業XD);而測試集則像期末考,用完全沒見過的資料驗證 AI 是否真的學會了、具備舉一反三的能力。
AI 每看到一張圖片,就會試著做出判斷,如果猜錯了,它就會根據錯誤去調整,反覆這樣學習幾萬、甚至幾千萬張圖片。整個過程會透過 GPU(圖形處理器)來加速,因為 AI 模型裡的計算牽涉大量矩陣運算,而 GPU 最擅長的正是這類平行處理任務。
這種訓練方式叫做「監督式學習(Supervised Learning)」,是很多 AI 模型的訓練基礎。
那其他類型的 AI 是怎麼訓練的呢?
其實不只是圖像分類,很多你熟悉的 AI 模型,背後都有類似的學習邏輯,只是訓練資料和方式不太一樣:
🔊|語音辨識(像 Siri、Google Assistant)
- 資料來源:人類說話的音訊檔 + 對應的文字稿
- 模型任務:學會把語音訊號轉換成文字(例如:你說「開啟計算機」,AI 要能正確轉出字)
- 技術方法:早期用 RNN / LSTM,現在也逐漸轉向 Transformer 架構
- 訓練難點:語音有方言、口音、背景音等變數,需要大量資料訓練
📖|NLP 語言模型(GPT、Gemini、Claude)
- 資料來源:大量的網路文本、書籍、網站、論壇等
- 訓練方式:一開始讓 AI 猜「下一個字是什麼」來訓練語言理解
- 額外加強:最後加入 RLHF(人類回饋訓練) 的步驟,由人來教 AI 哪種回答比較自然,讓 AI 輸出的內容更像真人
- GPU 需求極高:訓練 GPT 類模型往往需要數千張 A100 或 H100

🎨|影像生成(Midjourney、Stable Diffusion)
- 資料來源:圖像 + 對應的文字描述(例如:「一隻在海邊跑步的柴犬」)
- 訓練方式:讓模型學會「文字→圖像」的關聯,後來能依據提示詞生成新圖片
- 技術方法:使用「擴散模型(Diffusion Model)」訓練,從雜訊中還原圖像
- 優化方向:學習如何生成清晰、風格一致的圖,而不是只是隨機畫圖

總結所有 AI 的訓練方式:
其實 AI 就是把大量資料餵進伺服器,然後給它「正確答案」當作參考,再透過評分機制不斷優化產出的內容品質,讓它學會從中找出找出規律變得更好。
這個過程就像不斷學習做題目、修正、再練習,最後慢慢掌握怎麼判斷和回應。

再舉例一下,像 GPT 這類的語言模型會根據你輸入的內容,從它「訓練過的知識」中產生回應。雖然它的回答是機率性的 (也就是有點隨機的成分),但這個隨機不是亂猜,而是經過不斷訓練,讓猜測答案時變得更精準。這也是為什麼你和別人問一樣的問題,AI 給出的回答可能主軸一樣,但細節字句會不太一樣。這種設計讓回覆更自然、更接近人類對話的感覺。
AI 的突破關鍵,不在於它有多聰明,而是我們發覺更合適的方式來訓練它。
從 1956 年的符號式 AI、1980 年代的專家系統,到 2012 年的深度學習與近年來強調人類回饋的 RLHF,每一次 AI 技術的飛躍,背後的核心其實都是「優化訓練流程」。
換句話說,AI 的進化是靠資料、邏輯、與人類持續優化流程。訓練過程中最關鍵的差異,也正是從「人寫規則」的符號式 AI,進化為「AI 自己學規則」的機器學習,再到「學會模仿人類喜好」的 RLHF。
最後也許你也發現了:市面上 AI 工具百百種,那該怎麼與它們好好溝通?不同 AI 要下的指令方式是否一樣?
下一篇,我們就來聊聊 「通用的 AI 指令設計邏輯(Prompt 思維)」,帶你掌握讓 AI 真正變聰明的關鍵技術!







發表迴響