大型語言模型 (LLMs) 是什麼?
一篇看懂預訓練、微調與架構
從 ChatGPT 的對答如流,到 GitHub Copilot 的程式碼自動補全,大型語言模型 (LLMs) 正在以前所未有的方式改變世界。隱藏在這神奇魔法背後的,究竟是怎樣的運作原理?本篇深度指南,將為您剝絲抽繭。
一、LLMs 的基石:改變一切的 Transformer 架構
在 LLM 的心臟地帶,是一種名為 Transformer 的特殊神經網路模型。在它於 2017 年被提出之前,AI 理解語言的方式更像是「逐字閱讀」,很難真正掌握長句話中的複雜語意關聯。
注意力機制 (Attention Mechanism)
Transformer 的革命性之處在於它讓模型在處理一個詞 (Token) 時,能夠同時關注到句子中所有其他的詞,並計算它們之間的相關性權重。這使得 AI 不再是線性閱讀,而是能像人類一樣,全盤理解上下文。
在這種架構下,模型透過自監督學習 (self-supervised) 的方式,進行海量的「Token 預測」任務——簡單來說,就是不斷練習「猜下一個字」。正是透過數十億、甚至數兆次的猜測與校正,模型才逐漸學會了語言的文法、語意、甚至其中蘊含的世界知識。這篇開創性的論文 Attention Is All You Need 奠定了現代所有主流 LLM 的基礎。
二、AI 學習的兩大階段:通識教育與專業科目
1. 預訓練 (Pre-training)
奠定知識廣度:通識教育
建立 LLMs 的第一步。您可以將這個階段想像成讓一個新生 AI 用數年時間,讀完人類歷史上幾乎所有的公開書籍、網站、論文等資料。
這個過程的目的不是為了讓它學會某項特定技能,而是為了建立一個對世界通用知識的廣泛理解。模型透過自迴歸 (autoregression) 的方式,不斷預測龐大語料庫中的下一個 Token。這為模型注入了通用的自然語言處理 (NLP) 能力,使其成為一個具備巨大潛力的「通才」。
2. 微調 (Fine-tuning)
雕琢專業深度:專業訓練
如果說預訓練是「通識教育」,那微調就是「專業科目訓練」。
在模型具備了通用知識後,我們就可以利用特定領域的、有標註的資料集,將它「雕琢」成我們需要的專家。微調的目標非常明確:利用高品質的範例,訓練模型以達成指定的任務。沒有精準的微調,預訓練出的模型將難以在特定任務上發揮商業價值。
微調應用比較表
| 微調目標 (Fine-tuning Goal) | 使用資料集範例 (Dataset Example) | 產出模型範例 (Example Output) |
|---|---|---|
| 打造 AI 聊天機器人 (Chatbot) | 大量的專業聊天對話紀錄 | ChatGPT, Claude, Gemini |
| 訓練程式碼助理 (Code Assistant) | GitHub 上數十億行的開源程式碼 | GitHub Copilot, AlphaCode |
| 培養特定領域專家 (Domain Expert) | 公司的內部 SOP 文件、法律判決書、醫療報告 | 企業內部知識庫 AI、法律/醫療問答 AI |
| 學習使用者指令 (Instruction Following) | 由「指令-期望回覆」構成的資料集 | 讓模型能理解「寫一首詩吧!」這類命令 |
最迷人的驚喜:LLMs 的「突現特性」
LLM 最令人驚訝和興奮的特徵之一,就是「突現特性 (Emergent Properties)」。這指的是當模型的規模(參數數量)和訓練資料量達到某個閾值後,會自發地獲得某些在設計之初並未被明確教導的能力。
例如,一個主要被訓練來預測文本的模型,可能會突然展現出不錯的數學推理能力、多語言翻譯能力、甚至是撰寫程式碼的能力。這些能力的出現,至今仍是 AI 研究領域中的一大熱點。許多學者認為,這代表著模型在學習語言結構的過程中,也間接學習到了隱含在語言背後的邏輯與世界模型。
常見問題快速 FAQ
結論:打造並收集自己的寶可夢 AI 機器人
理解大語言模型的運作核心,就像是獲得了一張通往未來技術的藏寶圖。其「通用預訓練 + 專業微調」的兩階段學習範式,為我們提供了一個強大的框架,能夠將龐大的人類通用知識,與特定領域的精深專業經驗相結合。
掌握這些基本原理,是任何希望利用 AI 力量的個人或企業的必修課。因為只有真正理解工具的原理,我們才能最大化地發揮它的潛力,創造出前所未有的價值。
