GEO / AI SEO 轉型前,先檢查網站可見度 預約診斷
AI 工具與應用

LLM 是什麼?大型語言模型的原理、極限與 2026 模型地圖

LLM 是什麼?一次看懂大型語言模型的核心機制:預測下一個 token。從 Transformer 起源、參數量演化到幻覺的成因,整理 context window、知識截止等規格欄位讀法,附 2026 年 8 月模型地圖與 AI 搜尋的關係。

LLM 大型語言模型從 token 預測、Transformer 到 RAG 與 AI 搜尋的完整圖解

你每天用的 ChatGPT、Claude、Gemini,背後都是同一種東西:LLM(Large Language Model,大型語言模型)。LLM 的本體,是一個吃進海量文字、被訓練成專門預測下一個 token 的機率模型。它不查資料庫,也不翻維基百科,它做的事只有一件:讀完你給的前文,算出接下來每個候選字詞的出現機率,挑一個接上去。寫長文、翻譯、寫程式,全是這個動作重複幾千次的結果。

重點先看

LLM 的核心動作只有一個:預測下一個 token(詞元)。流暢的長文與自信的錯誤答案,是同一個機率的兩面。

參數量、context window、知識截止、推理等級,是讀懂任何一顆新模型的必備欄位。

2026 年 8 月的前沿:OpenAI GPT-5.6 Sol、Claude 5 世代、Gemini 3.7 Flash;開放權重有 gpt-oss、Llama 4、DeepSeek V4、GLM 5.2。

ChatGPT 是產品,LLM 是引擎;AI 搜尋是 LLM 系統加上檢索層,這幾件事經常被混為一談。

現在就能做的兩個檢查:花五分鐘打開你慣用模型的規格文件,抄下 context window 與知識截止兩個數字;再花一分鐘,拿你最熟的主題問它一題,驗一個事實。

文字是怎麼生出來的:一個 token 接著一個 token

先把最小單位講清楚。模型眼裡的文字不是一句一句,是被切好的 token。DeepSeek 的 API 文件給的定義很白:token 是模型能辨識的最小文字單位,可以是一個字詞、一個數字,甚至一個標點符號。切字的工具有名字,叫位元組對編碼(BPE),GPT-1 的原始論文用的版本,是把詞彙表合併了四萬次。你輸入的每個字都會先變成這種單位,模型再一個一個往後接。

LLM 逐一預測下一個 token 並組成完整句子的流程圖
LLM 不會先寫好整段答案,而是根據前文為下一個 token 計算機率,選出一個後再重複同樣步驟。

預測下一個 token,到底是什麼意思

GPT-4 技術報告摘要的第三句就是答案:GPT-4 是一個基於 Transformer 的模型,被預訓練來「predict the next token in a document」。聽起來樸素到不像話,這一句卻是整個世代的引擎原理。模型讀完前文,對詞彙表裡每個候選 token 算出一個機率,再從分布裡取樣。選中的 token 接上前文,過程重來一次,直到一段話長出來。

說穿了就一件事:理解、組織、輸出這些詞都是人類的事後描述,模型做的只有把「接下來接什麼最合理」連續回答幾千次。這中間沒有任何一個環節在查證事實。

給一個常見情境(示意)感受一下節奏:輸入「今天天氣真」,模型算出下一個 token 的候選機率,「好」排在前面,「冷」也有機會,選一個接上,再算下一個。你看到的整段回答,是幾千次這種選擇疊出來的。每一次選擇都只看「接上去合不合理」,整段的方向感,是你給的前文在牽。

2020 年的 RAG 論文從另一頭補了關鍵事實:大型預訓練語言模型會把事實知識儲存在參數裡。參數是模型內部由訓練學到的數值,從幾十億到幾千億個。知識的存放方式很特別:被壓進這些數字的統計規律裡,沒有哪一格寫著某個事實等你來翻。

兩個事實合起來,LLM 的本質就浮出來了:它生成的是統計上合理的接續,不是查表結果。合理與真實是兩件事。「巴黎是法國首都」在訓練文字裡出現過無數次,接對不稀奇;換成一個冷門年份、一個小眾產品的規格,訓練資料裡可能根本沒有足夠的例子,模型照樣會給你一個看起來像那麼回事的接續。寫得出長文與講錯基本事實,是同一個機制的兩面,後面講幻覺時會再回到這一句。

你還握得到一個變因:溫度(temperature)。Gemini 的 API 參考資料寫明,這個選填參數控制輸出的隨機程度,值可落在 0.0 到 2.0 之間。溫度低,模型偏向挑機率最高的接續,答案穩但容易呆板;溫度高,分布被拉平,冷門選項有機會出頭,創意與亂講的機率一起上升。沒有哪家公司靠調溫度解決正確性問題,原因回到上一段:隨機性只是表面的旋鈕,機率分布本身才是本體。

Transformer 是哪來的

2017 年 6 月,一篇標語很囂張的論文放上 arXiv:《Attention Is All You Need》。八位作者,掛 Google Brain 的三位,掛 Google Research 的三位,一位是多倫多大學的大學部學生 Aidan Gomez,在 Google Brain 實習期間完成工作,另一位 Polosukhin 的工作則是在 Google Research 期間做的。論文摘要的核心主張用一句話講完:提出一個新的簡單網路架構 Transformer,只以注意力機制為基礎,徹底捨棄遞迴與卷積。

Transformer 使用 self-attention 連結句子中不同 token 的概念圖
Transformer 的 self-attention 讓每個 token 能依上下文關注其他位置,並且比循序處理更適合平行運算。

在它之前,處理序列的主流做法要按順序逐個位置算下去,難以放大規模。注意力機制讓每個 token 直接看見前文所有位置,關係再遠都拉得到,而且可以大量並行計算。注意力做的事可以想得更白話一點:每生成一個字,模型都替前文每個位置打一次相關度分數,誰跟當前要接的字最有關,誰的影響力就大,加權之後彙整成一個決定。這個動作在數學上可以切開平行做,於是堆 GPU 就有效,規模化的大門從此打開。論文裡的實驗數字很有說服力:在 WMT 2014 英翻德拿到 28.4 BLEU,英翻法拿到 41.8 BLEU,其中一個模型的訓練只用了八張 GPU 跑 3.5 天。翻譯比賽從此換了霸主,更重要的是,一個撐得起千億參數的架構出現了。

放大從兩個方向發生。OpenAI 走生成路線,2018 年的 GPT-1 是一個 12 層、僅解碼器的 Transformer,768 維狀態、12 個注意力頭,在七千多本書上做預訓練。參數量坊間常寫一點一七億,其實原始論文裡沒有這個數字,Hugging Face 上的官方模型卡把權重加總是 119,680,512,約 1.2 億。以 2026 年的眼光看,這個量級小得可愛。Google 自己走了另一條路,2018 年 10 月提出 BERT,一樣基於注意力,規格分 1.1 億與 3.4 億參數兩種。兩條路後來勝負分明:今天你用的每一個聊天模型,血統都是 decoder-only 這一支。理由不神祕,decoder-only 的訓練任務就是接龍,跟「給一段話、往下寫」的生成任務完全同構,預訓練做的工,就是產品要做的事。

參數量兩年漲千倍,模型世界的時間軸

從一億參數到 ChatGPT 之夜

2019 年的 GPT-2 論文,最大模型十五億參數。2020 年 5 月的 GPT-3 論文有三十一位作者掛名,最大模型一千七百五十億參數,訓練總共看過 3,000 億個 token。這個數字的單位要寫死:它是訓練過程消耗的詞元總量,原始語料集比這個大。論文裡的家族更有意思,從 1.25 億、3.5 億、7.6 億、13 億、27 億、67 億、130 億一路排到 1,750 億,「放大」本身就是那幾年的研究主題,能力的躍升幾乎跟著尺寸走。從 GPT-1 到 GPT-3,參數量漲了一千多倍,論文展示的能力也從接句子,變成給幾個範例就能做任務。

從 Transformer、GPT 到推理模型與 AI 搜尋的 LLM 演進時間軸
LLM 的演進不只是一味增加參數,還包括 instruction tuning、推理能力、工具使用與檢索整合。

真正的轉折不是模型,是產品。2022 年 11 月 30 日,OpenAI 把一個對話介面包在模型外面,叫 ChatGPT。第三方機構估計,兩個月後它的月活用戶破一億;這個數字來自 UBS 與 Similarweb 的估計、經媒體報導,OpenAI 自己從未公佈。語言模型的能力在 2020 年就已經到位,把它推到大眾眼前的是 2022 年那個對話框,介面讓技術變成了日用品。2023 年 3 月 14 日 GPT-4 發表,技術報告隔天提交,模型開始接受圖片與文字輸入。

推理模型與 AI 搜尋的年代

2024 年 9 月 12 日,o1-preview 公告的定位是為解決難題而生的推理模型系列,模型的行為多了一層:回答之前先展開一段自己的思考過程。同年 10 月 31 日 ChatGPT search 上線,回答開始附上網頁連結。2025 年 5 月 20 日的 Google I/O,把客製版 Gemini 2.5 帶進 Google 搜尋的 AI Mode 與 AI Overviews。到了 2026 年,Anthropic 新聞室的日期可以當里程碑看:Sonnet 5 在 6 月 30 日發表,Opus 5 在 7 月 24 日發表。

這條時間軸給你的判斷,比記日期重要:模型的爆發期在 2018 到 2020,產品化在 2022 之後,2024 年起的故事都是模型加檢索、模型加工具。只看參數量的年代過去了。

時效常識也要補一句。2026 年 8 月 25 日當天,OpenAI 模型總覽上的旗艦才從 GPT-5.2 換成 GPT-5.6,GPT-5.2 的模型頁隨即改標成前一代旗艦。任何「目前最新」的說法,壽命可能只有幾小時。

預訓練之後:RLHF 怎麼把模型教成助手

預訓練結束的模型,只會把句子接得漂亮,不一定是個好助手。你問它一家公司的近況,它可能接一段新聞腔的泛論;你叫它停下來,它未必聽得懂。ChatGPT 上線公告寫得很清楚:他們用人類回饋強化學習(RLHF)訓練它,方法與 InstructGPT 相同。

LLM 從預訓練、指令微調到 RLHF 對齊的三階段流程圖
預訓練讓模型學會語言規律,指令微調與 RLHF 再把它調整成能理解任務、符合人類偏好的助手。

管線拆開看是這樣的。先做監督式微調,人類寫示範回答讓模型模仿。接著收集比較資料,把模型的不同回答拿給人評比,用這些偏好練出一個獎勵模型。再來拿獎勵模型當裁判,用近端策略最佳化(PPO)繼續微調。公告裡特別寫明,整個流程做了好幾輪。

參數少一百倍,為什麼反而更好用

InstructGPT 論文的摘要裡有一個數字,直接推翻了參數量等於能力的直覺:參數量十三億的 InstructGPT,輸出被人評為勝過一千七百五十億參數的 GPT-3,參數少了一百倍。

預訓練給了模型語言能力,RLHF 那幾輪把它塑造成一個聽得懂人話、知道自己該在哪停的助手。對齊的工,讓小的贏了大的。你在產品裡感覺到的好用,有相當一部分來自這段後訓練,模型的尺寸只是故事的另一半。這也提前回答了一個常見問題:參數量是重要規格,但拿它當唯一排名,會漏掉更深的一層。

為什麼它寫得出長文,卻會講錯基本事實

幻覺是機率的副產品

幻覺不是 bug,是下一個 token 預測的副產品。OpenAI 在 ChatGPT 上線公告的限制段落寫得坦白:ChatGPT 有時會寫出看似合理但錯誤或無意義的回答,而且修復很困難。公告列了幾個難修的原因,其中一個值得展開:訓練過程中沒有真相的裁判。強化學習的回饋來自人對回答的偏好,沒有一個機制在每一步即時查證每句話的真偽,模型真正學到的,是哪種回答讓人滿意,事實對錯在這個迴圈裡沒有位置。

LLM 從流暢接續走向事實錯誤的幻覺成因示意圖
語句流暢只代表接續機率合理,不等於事實已經查證;冷門資訊與缺乏來源時,錯誤也可能看起來很有把握。

把這句接回機制就通了。模型被訓練成預測合理的接續,當問題落在它統計規律模糊的區域,它還是會給出接續,只是根據不足。流暢是格式,不是證據。人名配頭銜、論文配年份、產品配規格,這些格式正確但內容無據的組合,就是幻覺最常見的長相。你也因此有一個實用的直覺檢查法:越是格式工整的具體斷言,越要動手驗。

公告裡還列了兩個難修的原因,一句帶過就好:把模型訓練得更謹慎,它會連自己答得到的問題都開始拒答;而人類示範者知道的與模型知道的不一致,示範本身反而會誤導它。你在大語言模型身上感覺到的「過度保守」與「莫名閃躲」,源頭都藏在這種結構性兩難裡,單靠更多訓練很難兩全。

兩個繼承自訓練的毛病

冗長與重複措辭。公告裡也承認,模型常常過度冗長、重複特定的表達方式,原因出在訓練資料的偏好:示範者傾向給看起來更全面的長答案,加上已知的過度最佳化問題。你在 2026 年的模型裡,仍然感覺得到這個傾向的殘影。

對措辭敏感。公告的另一句話:同一個問題換個問法,或同一個 prompt 重複幾次,答案會不一樣。這不是模型壞了,是取樣的本質。實務上的意義很直接:重要的問題換兩種問法再問一次,答案一致,信心才值得往上調。

規格欄位到底在講什麼

看模型新聞的能力,一半靠看懂規格表。四個欄位構成骨架:context window、max output、知識截止、推理等級,後面的對照表一次收齊。

context window、知識截止與推理等級三個 LLM 規格欄位說明圖
讀模型規格時,context window 是單次可處理的上下文量,知識截止描述訓練資料時點,推理等級則影響回答前的計算投入。

context window 是模型的短期記憶

Gemini 官方的長脈絡文件給的類比最好用:人的短期記憶能存的資訊有限,生成式模型也一樣;context window 的一個類比,就是短期記憶。你在對話裡貼過的文件、講過的要求、它答過的話,全部都要擠進這個空間,擠不進去的等於不存在。

數字的演化有刻度可循。早期生成式模型一次只能處理 8,000 個 token,後來推到 32,000、128,000,Google 稱 Gemini 是第一個能接受 100 萬 token 的模型。這個「第一」是 Google 自己的說法,其他家未必買單,但 1M 這個量級確實變成了前沿標配。

100 萬 token 是多少?官方換算:約 50,000 行程式碼(每行 80 字元)、八本平均長度的英文小說、五年的簡訊、兩百集以上 podcast 的完整文字稿。換白話講,把一個中型專案的程式碼整包倒給它讀,是做得到的。

工作空間聽起來像記憶體,其實更像桌面。對話超過上限,最早的內容就滑出視野,它不會替你保存。每次新對話都從空桌面開始,這是模型的天性,產品層也補不了。

知識截止為什麼有兩種日期

規格表上的 cutoff 常讓人誤會。Anthropic 的模型文件把日期分成兩種:可靠知識截止,指模型知識最完整、最可靠的日期;另一種標的是訓練素材本身,它涵蓋的範圍通常更廣、也更晚才收尾。一顆模型可能訓練素材收到夏天,可靠知識只敢保證到當年初。看規格時認清楚問的是哪一種,兩個數字可以差好幾個月。

模型本身的截止日是固定的。產品接了檢索層之後,回答可以比截止日新,ChatGPT search 與 Google 的 AI Mode 都屬於這類;但那是檢索層抓了新網頁,模型的參數一個字都沒變。問它最近的事,先確認你用的是不是有接檢索的產品。

推理等級:回答前願意想多深

還有一個欄位正在變成標配:推理等級。Gemini 的 API 有 thinkingLevel 可以選,DeepSeek 的 V4 把 thinking 模式設成預設開啟,GPT-5.6 的 effort 從 none 一路到 max 共六檔。這個欄位的本質是時間換正確率,模型願意在回答前多展開幾輪自己的推演,難題的正確率上升,回應變慢、計費變貴。把它當作可調的旋鈕來用就好,同一顆模型,開低檔跟開高檔是兩種工作節奏。

四個欄位讀完,你可以直接做一個練習:挑一顆你正在用的模型,把四個數字都查出來,跟兩年前你剛註冊時的印象比一比。數字變化的方向,就是整個產業前進的方向。

表說:規格欄位對照過一輪,之後看任何新模型發表都不會迷路。

欄位白話數字變大代表什麼什麼情況你該在乎
context window單次對話的工作空間能塞更長的文件與對話常丟整份文件或長程式碼才需要追大
max output單次回答的長度上限一次能產出更長的成品要它一次寫完整章、整份報告時
知識截止模型可靠知識的邊界日期越新,需要檢索補的洞越少問時事之前先看這格
推理等級(thinking/effort)回答前願意想多深難題的正確率換時間簡單問題調低省時間,難題調高

2026 年 8 月的模型地圖

講模型現況,時間戳先蓋下去:以下全部以 2026 年 8 月為準,而且你該假設它隨時會翻頁。

依開放權重、閉源服務、通用與推理能力整理的 LLM 模型地圖
模型地圖應先看部署方式與任務需求,再比較能力、成本、延遲與 context window,不宜只追逐單一排行榜。

先看封閉前沿。OpenAI 的模型總覽上,旗艦是 GPT-5.6 Sol(API 型號 gpt-5.6-sol),1,050,000 context、128,000 max output、可靠知識截止 2026 年 2 月 16 日,effort 從 none 到 max 共六檔;家族除了 Sol、Terra、Luna,還有做資安特化的成員,別把它想成一張封閉清單。站上有 GPT-5.6 的完整個案可以對照。Anthropic 的模型總覽開頭自述得很直白:Claude 是 Anthropic 開發的一系列最先進大型語言模型。這個世代是 Fable 5、Opus 5、Sonnet 5 全線 1M context、128K max output,可靠知識截止分別到 2026 年 1 月、5 月、1 月,旁邊還有 200K 的 Haiku 4.5,Opus 5 的定位偏長時間運作的代理與專業工作。

Google 這邊,現役最新是 Gemini 3.7 Flash,官方自述最新最強的 Flash 型號,前一代 3.6 Flash仍在線。xAI 的 Grok 同場競爭。

還要先把一個印象修掉:前沿早就不是純文字模型了。GPT-4 起官方自述就寫明接受圖片與文字輸入,各家的列表裡有影片生成、原生音訊、圖片生成。但這些系統的核心骨幹仍然是語言模型,多模態是把別種感官接上同一個生成引擎,架構的道理沒有換。

再看開放權重。封閉與開放的分界,就在權重拿不拿得到。OpenAI 首次跨進這一側:gpt-oss-120b 官方自述最強開放權重模型、一張 H100 就放得下,另有主打低延遲的 gpt-oss-20b。Llama 官方網站上的 Llama 4 有 Maverick 與 Scout 兩員,都標 10M context,頁面上的成本估計每百萬 token 0.19 到 0.49 美元,註明是 Meta 自己的估算;Llama 3 家族也還在線上服務,3.1 最大到 4,050 億參數,開放陣營的縱深比想像中厚。

DeepSeek 的 API 首頁列著 V4 家族,1M context、最高 384K 的輸出,thinking 預設開啟,格式與 OpenAI、Anthropic 相容,價目也透明:v4-flash 輸入每百萬 token 離峰 0.22 美元、尖峰 0.44 美元,輸出 0.66 到 1.32 美元。GLM 的開放權重跟到 5.2,5.3 這一代尚未開放權重。

老實說,多數人不需要記住這串名單,你需要的是一張分組的地圖,型號換了地圖還能用。

表說:先認陣營再認型號,比背排名省力。

陣營代表型號(2026 年 8 月)context 規模適合誰什麼情況不用追它
封閉前沿GPT-5.6 Sol、Claude 5 世代、Gemini 3.7 Flash1M 級要最強推理與產出品質的重度使用者日常問答,中階型號就夠
開放權重gpt-oss-120b/20b、Llama 4、DeepSeek V4、GLM 5.21M 到 10M要自己部署、控制成本與資料的團隊沒有工程能量,先用 API
小型模型Llama 3.2 的 1B/3B 這一級以裝置端跑得動為前提手機、邊緣裝置、離線場景需要頂級推理時別勉強

讀懂一顆新模型發表的判斷工具

規格先於形容詞。看到「最先進」「旗艦」這類詞,先找 context window、max output、知識截止、推理等級四個數字,找不到就當廣告看。自稱「第一」的句子看誰說的:Gemini 第一個支援 1M 是 Google 的說法,Llama 4 的 10M context 同樣是官方宣稱,行銷語與可驗證的規格要分開放。

型號對照也是基本功。ChatGPT 介面上顯示 GPT-5.6,API 文件裡的型號是 gpt-5.6-sol,兩個名字指同一家族;看懂這層對照,你不會把產品版本與模型型號誤讀成兩顆不同的模型。然後記得規格頁的保鮮期很短,前面那個當天換旗艦的例子,就是 2026 年 8 月的真事。文件快照也會滯後,同一輪觀察裡,Anthropic 的模型文件一度還停在 4.5 家族,新聞室卻已經發了 5 世代;文件與公告交叉著看,比單看一邊穩。

ChatGPT、Agent、RAG、搜尋引擎跟 LLM 的分界

引擎與車:LLM 跟 ChatGPT 差在哪

LLM 是引擎,ChatGPT 是把引擎包進對話介面的產品,外圍加了介面、對話管理、檢索與各種工具。同一顆引擎可以裝進不同的車:客製版 Gemini 2.5 同時驅動 Google 的 AI Mode 與 AI Overviews,就是一顆模型多個產品的現成例子。

LLM 與 ChatGPT、AI Agent、RAG、搜尋引擎和 SLM 的關係圖
LLM 是生成引擎;ChatGPT 是產品介面,Agent 加上工具與行動能力,RAG 加上外部檢索,搜尋引擎則以索引與排序為核心。

OpenAI 在上線公告裡講過對話格式帶來的能力:ChatGPT 能回答追問、承認自己的錯誤,甚至質疑你題目裡的錯誤前提。這些行為有相當部分來自產品層的對話設計與 RLHF,裸模型天生未必會。把 LLM 跟 ChatGPT 分開看還有個實際好處:模型規格看 API 文件,產品功能看產品側的教學,兩邊更新節奏不同,混著讀會一直困惑。

大腦與手腳:LLM 跟 AI Agent

Gemini API 文件給 Tool 下的定義可以當地基:工具是讓系統在模型的知識與範圍之外、與外部互動以完成動作的程式。模型本身只會生成文字,它不會查資料庫、不會寄信、不會改檔案;接上工具與迴圈,它從說話的變成做事的。LLM 是大腦,Agent 是大腦加手腳的組合。這個式子的產品化到處都是:Claude 的產品線裡有負責寫程式的 Claude Code 與並肩工作的 Cowork,DeepSeek 的文件也單獨列了代理整合的段落。判斷一個 AI 產品是不是 Agent,看它有沒有工具與迴圈,別看它講得多流利。

查資料的架構:LLM 跟 RAG

RAG 常被誤當成另一種模型,它是檢索增強生成,一種幫 LLM 查資料的架構模式:先檢索相關文件,把找到的內容放進 context,再讓模型根據這些內容回答。RAG 論文的出發點,正是前面那句事實:模型把知識存在參數裡,但存取與精確操作知識的能力有限。公司內部知識庫問答、AI 搜尋引擎的檢索層,骨子裡都是這個模式。它同時也是知識截止的標準解法:參數裡沒有的新東西,檢索層現場抓網頁來補。選模型時沒有「有沒有 RAG」這一格,RAG 是你或產品在模型外面加的工。

檢索排序與機率取樣:LLM 跟搜尋引擎

Google 搜尋做的是對索引的檢索與排序,它找到的是別人寫好的網頁;LLM 做的是對機率分布取樣,它現場生成一段沒人寫過的答案。一個回答「哪裡有」,一個回答「是什麼」。這也是 AI 搜尋存在的理由:把兩者接起來,檢索層找料,模型層組織成答案。

大跟小的分界:LLM 跟 SLM

大小沒有官方分界線,業界用的判準大致是參數量級、能不能在手機或邊緣裝置上跑、成本。Llama 3.2 的 1B 與 3B 型號,官方形容是輕量、省成本、到哪都能跑。回頭看更有趣:2018 年的 GPT-1 約 1.2 億參數,以今天的標準就是 SLM 尺寸,當年可是不折不扣的大型語言模型。大型是相對詞,這個詞的門檻一直在搬。分野的細節與挑選邏輯,小型語言模型的專文談得更完整。

AI 搜尋是 LLM 系統加上檢索層

Google 怎麼做 AI 搜尋

2025 年 5 月 20 日的 Google I/O 公告寫明:客製版 Gemini 2.5 進駐美國版的 AI Mode 與 AI Overviews。AI 搜尋不是搜尋引擎變魔術,是 LLM 系統加了檢索層。ChatGPT 那頭同理,2024 年 10 月 31 日 ChatGPT search 上線,回答附上網頁來源。兩家產品的形狀不同,式子一樣。

Google 官方影片示範 AI Mode 如何以對話回覆、追問與網頁連結延伸搜尋,對應本節所說的『LLM 系統加上檢索層』。
AI 搜尋從查詢拆解、網頁檢索到 LLM 組織答案與引用來源的架構圖
AI 搜尋不是單獨一顆 LLM,而是把查詢拆解、網頁檢索與排序、內容生成和來源引用串成一個系統。

對內容經營者的關鍵訊息,Google Search Central 的文件講得罕見地白:AI 功能沿用好既有的 SEO 最佳實踐,要出現在 AI Overviews 或 AI Mode 沒有額外要求,也不需要其他特殊最佳化。換句話說,把內容與結構做扎實,比追逐任何新密技實在。AI 時代的 SEO 怎麼想AI Overviews 的運作ChatGPT 搜尋怎麼挑來源,站上各有專文展開;想系統性追蹤這個題目的人,也可以從 LLMO 的角度切入。

爬蟲的身分與你的 robots.txt

AI 公司讀你的網頁,用的是各自的爬蟲,而且同一家公司不同用途用不同身分。OpenAI 的爬蟲文件分得清楚:GPTBot 抓的內容可能用於訓練。OAI-SearchBot 為搜尋服務,網站封鎖它,內容就不會出現在 ChatGPT 的搜尋答案裡。ChatGPT-User 是使用者提問時的即時抓取,官方明講這類動作由使用者發起,robots.txt 規則可能不適用。robots.txt 的更新,OpenAI 說大約 24 小時生效。

Anthropic 的爬蟲說明列了三隻:ClaudeBot 收集可能有助訓練的內容,Claude-User 在使用者提問時抓頁面,Claude-SearchBot 為提升搜尋結果品質而爬。Google 的爬蟲文件裡有個常被誤解的名字:Google-Extended。它是獨立的產品權杖,讓發布者管理內容能否用於訓練未來世代的 Gemini,它沒有自己獨立的請求身分,也不影響網站在 Google 搜尋的收錄,更與排名訊號無關。想控制訓練用途又怕影響搜尋流量的人,這一段可以直接抄進決策筆記。

一個 SEO 站的實測數字

講概念不如看數字。這個站做了一個觀測:在 Cloudflare 邊緣部署 Worker,判讀每個請求的 User-Agent,把已知 AI 爬蟲的抓取寫進 D1 資料庫,報告端點即時彙整。結果之一:談實體 SEO 的那個頁面,七天內被 AI 爬蟲抓取超過 12,000 次。這套基礎設施用的是 Cloudflare 免費額度,Workers 每天 10 萬次呼叫、D1 每天 10 萬行寫入,兩個額度分開算,個人站負擔得起。

這個數字要配上界線讀:被抓取,不等於被引用。請求是可數、可查證的事實;引用發生在答案引擎的輸出裡,外人看不見,只能人工抽樣逼近。把抓取量當引用量匯報,是這個領域最常見的膨風。

觀測還會吐出另一種訊號:AI 爬蟲來要、站上卻回 404 的路徑。這些路徑等於 AI 明確表達了想要哪個內容,想找選題的人,這份清單比靈感可靠。

工具也有盲區。GA4 靠瀏覽器端的 JavaScript 記錄,AI 爬蟲在伺服器端取用 HTML、不執行 JavaScript,GA4 對這群流量近乎全盲;Search Console 只記錄 Google 搜尋。想知道 AI 到底有沒有來抓,得自己在邊緣量。完整的觀測方法與數字,站上的報告寫得很全。

看完之後,你可以做的下一步

先花五分鐘,打開你慣用模型的規格文件,把 context window 與知識截止抄下來貼進筆記。驗收標準:你能對同事說出「超過多少它開始忘記、多新以後它不知道」,說得出來就算過關。還沒決定用哪家的話,ChatGPT、Claude、Gemini 在台灣都能直接註冊,挑一個順手的開始就好,工具之間的差異遠小於用與不用。

選擇 LLM 前檢查 context window、知識截止、來源與事實驗證的行動清單
面對新模型發表,先確認官方規格、context window、知識截止、來源可追溯性,再用熟悉題目做事實驗證。

再花十分鐘做個壓力測試:挑一個你比模型熟的主題,問它幾個具體問題,找出它講錯或含糊的地方。這一步的目的在建立你對它能力邊界的體感,邊界感會直接改變你之後怎麼用它。想再進一步,拿你自己網站的內容問它,看它怎麼轉述你寫過的東西,錯得最有創意的地方,就是它對你那個領域統計規律最薄弱的地方。

該做的:重要輸出的關鍵事實另行查證,重要的問題換問法再問一次,規格數字白紙黑字記下來。別做的:把流暢當正確、把參數量當排名、把生成出來的日期當成查證過的日期。守住這幾條,LLM 就從神奇的黑盒子變成順手的工具,剩下的熟練度交給時間。

常見問題

ChatGPT 跟 LLM 差在哪?

ChatGPT 是產品,LLM 是產品裡的模型。判斷方法很機械:你打開的是網站或 app,那就是產品;規格文件裡的型號(gpt-5.6-sol 這類)才是模型。一顆 LLM 可以被裝進多個產品,一個產品也會隨改版換模型,所以「ChatGPT 變好用」與「LLM 變強」是兩句不同的話,前者可能只是產品層加了功能。

LLM 跟 AI 差在哪?

AI 是更大的傘,LLM 是其中處理語言的一族。OpenAI 爬蟲文件裡用的詞是 generative AI foundation models,生成式 AI 的基礎模型;LLM 是這群基礎模型裡以語言為主場的那一支。影像生成、語音辨識也常被歸在生成式 AI 底下,它們就不是 LLM。看新聞時把「AI 進展」翻成「哪一族的進展」,句子會立刻清楚。

參數量越多就越強嗎?

不必然,而且前沿早就不再公開這個數字。GPT-3 之後,OpenAI 從未公佈 GPT-4 的參數量,網路流傳的各種大數字都是未經證實的推測。能力還取決於訓練資料的質量、訓練量與後訓練的對齊工,InstructGPT 用少一百倍的參數贏過 GPT-3 就是老證據。規格表上現在更有判斷力的欄位,是 context window 與推理等級。

它會記得我上個月跟它說的話嗎?

要看你講的是模型的記憶還是產品的記憶。模型的 context window 是單次對話的工作空間,對話結束或超過上限,內容就滑出範圍;跨對話還記得你,是產品把你的偏好存在資料庫裡再餵回給模型,屬於產品功能,模型本身沒有這種天性。分不清的時候做個測試:換一台裝置、清掉紀錄還在的,就是產品存的。這也解釋了一個日常困惑:為什麼長對話聊到後面,它開始忘記前面講過的事,那就是內容滑出工作空間的瞬間。

知識截止之後發生的事,它完全不知道嗎?

模型本身不知道,這條邊界不會因為你換個問法就消失。但接了檢索層的產品可以回答新的東西,因為答案的原料是檢索層現抓的網頁,與模型參數無關。實務上有個檢查法:看回答有沒有附來源連結,有連結的答案背後通常有檢索層;完全沒有來源的斷言,就當成截止日之前的知識在講。

幻覺可以靠 prompt 完全消除嗎?

辦不到,這是官方都承認的難題。降低的方法存在:把已知事實寫進 prompt、要求它分開處理確定與不確定的部分、難題打開推理等級。但模型的底層是機率接續,prompt 調整的是輸入條件,查證這件事它做不到。重要的數字與引述,最終的查證責任都在你身上,這條線畫清楚,用起來反而順手。

開放權重模型跟閉源模型怎麼選?

看你要不要自己跑。開放權重代表權重檔下載得到,可以自己部署,成本、隱私、客製都操之在己,代價是要有工程能量與硬體,gpt-oss-120b 官方說一張 H100 放得下,那可是伺服器等級的卡。閉源模型走 API,什麼都不用管,按用量計費,隨時換最新型號,而且 API 的單價一直在往下探,DeepSeek V4 的 flash 每百萬 token 輸入離峰只要 0.22 美元就是一例。個人與多數小團隊從 API 開始,碰到成本或資料管控壓力再考慮搬。

LLM 會取代搜尋引擎嗎?

與其說取代,說合流更準。搜尋擅長檢索與排序,模型擅長理解與生成,AI 搜尋把兩層接起來,各做各的強項。對使用者,答案變成現成生成的;對內容經營者,你的頁面還是要先被檢索層找到,這也是 Google 說 SEO 沿用的原因。被取代的行為是自己翻十條連結,搜尋本身正在升級,沒有消失。

留下你的問題或補充

你的電子郵件不會被公開。