研究

LLM 是什麼?從詞元到上下文視窗,一次搞懂大型語言模型

LLM 是大型語言模型的縮寫,靠海量文字訓練來預測下一個詞。這篇從詞元、訓練流程講到上下文視窗與幻覺,把它的運作邏輯與能力邊界拆開來看,並說明它跟搜尋引擎差在哪。

陳柏宇陳柏宇
熱度:1,050
LLM 是什麼?從詞元到上下文視窗,一次搞懂大型語言模型

LLM 是近幾年最常被掛在嘴邊的三個字母,但真正說得清楚它怎麼運作的人不多。這篇從詞元開始,一路講到上下文視窗與幻覺,把大型語言模型的底層邏輯拆給你看。

LLM 全名是什麼,它到底在做什麼

LLM 是 Large Language Model 的縮寫,中文叫「大型語言模型」。拆開來讀,每個詞都對應它的一個特性:Large 指的是參數量與訓練資料量的規模,Language 指的是它處理的對象是人類語言,Model 指的是它本質上是一個數學模型。

講得更直白一點,它是一套靠海量文字訓練出來的預測系統。你給它一段文字,它會算出下一個最可能出現的詞是什麼,接著再算下一個,一個接一個接下去。整段回答就是這樣一個詞一個詞「猜」出來的。

聽起來很簡單,效果卻出乎意料。當訓練資料夠多、參數夠大時,這個「猜下一個詞」的動作會浮現出翻譯、摘要、寫程式、推理等能力。這些能力沒有被單獨教過,而是從大量文本裡自然長出來的。

它的用途也因此非常廣。寫信、改稿、解釋名詞、把資料整理成表格、幫你抓程式裡的錯誤,全部都是同一個底層機制在運作。理解這一點,你就不會再把它想成一個無所不知的資料庫,而是當成一個很會接話的助手。

詞元:模型眼中的文字單位

模型並不是以「字」為單位在讀你的問題,而是以「詞元」(token)為單位。詞元是文字被切碎之後的基本片段,可能是一個完整單詞,也可能是單詞的一部分、一個標點,或幾個中文字。

以英文來說,常見的短詞像 cat 會是單獨一個詞元,長一點的字像 understanding 可能被拆成兩三個詞元。中文則通常一兩個字算一個詞元,實際切法由各家模型的切詞規則決定。

這件事為什麼跟你有關?因為它直接影響兩件事:成本與容量。API 計價幾乎都是按詞元收費,輸入與輸出分開算;模型的記憶上限也是用詞元衡量。你打的字越多、模型的回答越長,消耗的詞元就越多。

養成估算詞元的習慣很有用。一句話大概十幾個詞元,一頁 A4 的英文文件約五百詞元。你不需要精算到個位數,但抓得出量級,就能預判一次對話大概要花多少。

它是怎麼學會說話的

訓練大型語言模型分幾個階段,第一階段是預訓練。研究團隊把網頁、書籍、程式碼等大量文本餵進去,讓模型反覆練習預測下一個詞。這個階段結束後,模型已經掌握了語言的結構與大量世界知識,但還不太會聽指令。

接著是微調與人類回饋訓練。研究人員準備大量「問題加理想回答」的範例,讓模型學會照著指令的格式回應;再靠人類對不同回答的偏好排序,調整它的輸出傾向。經過這一輪,模型才從「會接話」變成「會辦事」。

最後是對齊,也就是把安全與界線加進去。這一步決定模型遇到不當請求時會拒絕,遇到不確定的事該不該說不知道。近年各家模型在這方面的投入明顯增加,因為一個能力很強卻不聽話的助手,用起來風險太高。

訓練完成後,參數就固定了。你在對話框裡打的字不會改動模型本身,只會影響這一次的回答。這也是為什麼同一個模型,有人用起來很順,有人怎麼問都拿到廢話,差別多半在提示怎麼下。

上下文視窗:模型能同時記住多少

上下文視窗(context window)指的是模型在同一次對話裡,最多能同時「看到」多少詞元。它涵蓋你前面說過的話、你貼進去的文件,以及模型自己已經寫出的內容。

早期模型的上下文只有幾千詞元,貼一篇長文就爆了。到了 2026 年,主流模型的上下文動輒上百萬詞元,等於能一次讀進好幾本小說。這對處理長篇合約、整包程式碼、成堆客服紀錄的人來說,是實質的工作方式改變。

要注意的是,能裝進去不等於能記牢。內容一多,模型對中間段落的注意力往往會下降,業界俗稱「中間失落」。實務上的做法是把最重要的資訊放在開頭或結尾,或乾脆分段處理,而不是一股腦塞滿。

另一件容易搞錯的事:上下文視窗指的是單次對話的記憶,不是永久記憶。開一個新的對話,之前聊過的東西它就不知道了。想讓它記住跨對話的偏好,通常得靠額外的記憶或客製化功能。

為什麼它會一本正經地胡說

模型偶爾會產出聽起來很確定、實際上卻錯誤的內容,這就是所謂的「幻覺」(hallucination)。它會發生,根源在於模型的目標是「生成最像正確答案的一段話」,而不是「查證事實後再回答」。

當它對某個問題沒有可靠依據時,仍會照著語言的機率往下接,結果就是編出一段流暢但錯誤的回答。參考來源、人名、法條、程式函式庫名稱,都是幻覺的常見出沒地帶。

因應方式有幾種。一是把正確資料直接放進提示,讓它有依據可循,也就是檢索增強生成這類做法的精神;二是要求它標明不確定的地方;三是對重要資訊自己再查證一次。把模型當成會出錯的同事,而不是定稿的權威,是最務實的心態。

值得一提的是,2026 年的前沿模型在幻覺控制上已有明顯進步。以獨立評測機構 Artificial Analysis 的資料為例,GPT-6 Astra 在高強度推理設定下的幻覺率,比前一代的 GPT-5.6 Sol 從九成以上降到約五成,同時準確度還提升。不過「降低」不等於「消除」,關鍵場合仍需人工把關。

跟搜尋引擎差在哪

很多人第一個疑問是:它跟 Google 搜尋有什麼不同?差別在機制的本質。搜尋引擎是去網路上找既有的頁面,然後把連結排給你看;語言模型則是當場生成一段原本不存在的文字。

這帶來兩個直接後果。第一,模型可以寫出網路上沒有現成答案的內容,例如把你公司的內部規範改寫成公告。第二,它也可能生成網路上根本不存在的事,也就是前面說的幻覺。搜尋給你來源,模型給你成品,可靠度與便利性剛好互相拉扯。

現在的主流做法是把兩者接起來:先搜尋、再讓模型根據搜到的資料作答。這樣既有搜尋的即時與可查證,也有模型的整理與表達能力。你在 ChatGPT 或 Gemini 裡看到的「聯網搜尋」功能,走的就是這條路。

常見問題

LLM 跟 AI 是一樣的東西嗎? 不一樣。AI 是更大的範疇,涵蓋圖像辨識、推薦系統、自動駕駛等;LLM 只是其中專攻語言的一支。只是近年 LLM 太紅,很多人乾脆用 AI 代稱。

參數越多就越聰明嗎? 大致相關,但不是唯一因素。訓練資料的品質、訓練方法、後續的對齊與工具整合,都會影響最終表現。同一個參數規模的模型,實際能力可以差很多。

它會取代我的工作嗎? 這取決於工作型態。重複性的文書、整理、初稿撰寫,被大幅輔助甚至替代的壓力最大;需要判斷責任、人際信任、現場應變的工作,短時間內仍是人的主場。把它當成放大器,比當成取代者更符合現實。

需要懂技術才能用嗎? 不需要。多數人透過 ChatGPT、Gemini 這類對話介面就能用到它的核心能力。懂詞元與上下文的原理,主要是幫你少踩坑、用得更省。

想開始用的話,先搞懂這三件事

大型語言模型說穿了就是一個超大型的文字預測器,能力與限制都從這個本質長出來。它擅長生成流暢的內容,也正因為如此,特別容易在沒把握的地方硬編。

實務上只要記住三件事就好:詞元決定成本與容量,上下文視窗決定它一次能顧到多少,幻覺提醒你重要資訊要自己複核。把這三點放在心上,你就不會高估它,也不會白白浪費它的本事。

接下來想動手的話,找一個你每天都在做的麻煩事,用對話介面試著讓它幫你跑一次。比起讀再多原理,動手用一輪學得更快。

分享這則新聞

來源

相關 AI 新聞

OpenAI 開除三名安全研究員 涉及敏感資料分享
商業與產業

OpenAI 開除三名安全研究員 涉及敏感資料分享

OpenAI 證實開除三名安全研究員,理由是他們處理敏感資訊的方式違規。報導把事件和分享給外部 AI 安全組織的資料連在一起,而這家公司同一週早已風波不斷。

熱度:1,150
OpenAI Dots 是什麼?ChatGPT 常駐式 AI 智能體完整解析
AI產品

OpenAI Dots 是什麼?ChatGPT 常駐式 AI 智能體完整解析

OpenAI 推出常駐式 AI 智能體 Dots,可在 ChatGPT、Slack 與 Microsoft Teams 接收訊息並主動行動,例如依行事曆主動推薦外送選項。本文說明它怎麼運作、能做什麼,以及哪些事仍需人工。

熱度:1,200
OpenAI 安全主管 David Robinson 離職,直言公司文化已崩壞
商業與產業

OpenAI 安全主管 David Robinson 離職,直言公司文化已崩壞

OpenAI 安全報告主管 David Robinson 在任職三年半後離職,並於《大西洋月刊》撰文批評公司文化崩壞與迭代部署模式;OpenAI 回應稱安全仍是營運核心。本文整理雙方說法與對使用者的意義。

熱度:1,350
極簡編輯插畫,華盛頓監管建築輪廓與並排的 AI 實驗室圖示之間拉起一條審視線
商業與產業

FTC 調查 OpenAI 與 Anthropic 消費者保護疑慮

美國 FTC 對 OpenAI、Anthropic 等 AI 實驗室啟動正式調查,釐清模型是否危害消費者,並擬以民事調查令要求交資料、高層作證。

熱度:1,300