把雲端那種大型模型想像成中央廚房:什麼菜都做得出來,但每道菜都要排隊、按份計費,食材還得先送出門。小型語言模型(Small Language Model,業界慣用縮寫是 SLM)就是巷口的小廚房:能做的菜不多,但出餐快、成本低,而且食材不必離開你家。定義講得精確一點:SLM 是參數量明顯小於主流大型語言模型(Large Language Model,LLM)、小到能直接裝進手機、筆電或邊緣裝置裡運作的語言模型。如果你連 LLM 都還不太熟,可以先看大型語言模型與 LLMO 的基礎解析再回來。
你其實每天都在用它。iPhone 的聽寫與摘要、Android 的智慧回覆、Copilot+ 筆電上不連網也能跑的 AI 功能,幕後很多是裝在你裝置裡的小模型,不是雲端大模型。2026 年該把它弄懂的理由很實際:企業開始認真算 AI 的帳,而小模型正是把 AI 放進產品與工作流程時,成本最低、風險最可控的那一條路。
一句話講:小型語言模型(SLM)是參數量級較小、能在終端裝置上直接運作的語言模型,實務上常拿 100 億參數當分界。任務範圍明確、用量大、資料不能外流的場景優先考慮 SLM;開放式複雜任務,仍然交給 LLM。
文章目錄
小型語言模型是什麼?先把「參數」講清楚
語言模型的「大小」,指的就是參數(parameter)的數量。參數是模型內部經過訓練自動調出來的數字,你可以把它想成混音台上的旋鈕:訓練就是幾十億次地微調這些旋鈕,讓模型面對任何一段文字時,都能算出下一個字最可能是什麼。旋鈕越多,模型能記住的語言模式越細;代價是每回答一次問題,都要把所有旋鈕讀過一遍,越多就越慢、越貴。
參數量可以直接換算成硬體需求,這是評估時最實用的一步。以常見的半精度(FP16)儲存來估,一個參數佔 2 bytes:30 億參數的模型光權重就約 6GB,80 億就要 16GB,這還沒算推論時的額外開銷。所以「模型多大」幾乎等於「你要租多大的機器」,或者反過來問:我手上的裝置,塞得下多大的模型?
補一個常見的名詞混淆:參數量常被拿來跟上下文長度混為一談,其實是兩件事。參數是模型的腦容量,決定它學過多少東西;上下文視窗(context window)是模型一次對話能攤開的桌面大小,單位是 token,一個中文字大約佔一到兩個 token。Phi-4-mini 支援 12.8 萬 token 的上下文,一次能讀進整份長文件再作答;但讀得長不等於懂得深,桌面再大,腦容量不足一樣讀不懂。挑模型時兩個數字都要看,別只比參數。
「多少參數算小」為什麼沒有標準答案

因為業界真的沒有公訂數字,連微軟自己都給出兩種框架。微軟官方的概念文件寫得直接:一般而言,小型語言模型的參數少於 100 億個,大型語言模型則大於 100 億個。但同一間公司的 Azure 詞典,卻把 SLM 描述成「可能只包含數億個參數」,並拿超過一兆參數的 GPT-4 來對比。兩份官方文件、兩種框架,前者從部署難度切,後者從與旗艦模型的差距切,都對,也都不算公定標準。
與其背門檻,不如記「跑得動的硬體」。手機等級的例子:Google 針對行動裝置設計的 Gemma 3n E2B,官方文件標示最低 2GB 記憶體就能跑。筆電與工作站可以往 7B、8B 的量化版本伸手。順帶一提,SLM 不是這兩年才有的新發明:Google 早在 2019 年就把 BERT 這種幾億參數等級的語言模型放上搜尋前線,想了解那段歷史,可以看 BERT 走進 Google 搜尋的起點,它算得上今天所有端側小模型的老前輩。
SLM 跟 LLM 差在哪?四個真正影響選擇的軸線
差異不在「誰比較聰明」這種單一排名,而在四個軸線上的取捨:成本、延遲、隱私、能力上限。中央廚房與巷口小廚房的比喻可以一路用到底:中央廚房設備齊、什麼都做得出來,但每道菜都要排隊結帳;小廚房能做的菜有限,但下單到出餐的距離短,食材也不必出門。
成本這軸,微軟官方文件列出的小模型第一個優點,就是訓練和執行「速度更快且更具成本效益」。雲端大模型按用量計費,量大時帳單成長很快;端側或自架的小模型,主要的錢花在硬體與建置,之後每多跑一次的邊際成本趨近於零。
用一個量級感把這件事講具體:假設一條客服流程每天觸發一萬次摘要,一個月就是 30 萬次。旗艦模型與小模型的單價差距,在 30 萬次的乘數下,會從「有點貴」變成「預算會議的主題」;同樣的量交給端側或自架的小模型,增加的主要是電費與硬體折舊。成本這條軸的本質,就是用量把差距放大。
延遲與隱私常綁在一起出現。模型就在裝置上,少了網路往返與伺服器排隊,回應變快,斷網也照常工作;資料可以不離開裝置,這對個資、營業祕密或法規敏感的場景,經常是硬條件而不是加分項。
能力上限是 LLM 仍守住的區塊。開放式問答、跨領域知識、多步驟推理,旗艦大型模型明顯佔優,GPT-5.6 這一級的模型就是為這類任務設計的。反過來,把每天十萬次的文件分類交給 Claude Opus 5 這種旗艦,則是用大砲打蚊子,帳單會說話。
| 面向 | 小型語言模型(SLM) | 大型語言模型(LLM) | 怎麼選 |
|---|---|---|---|
| 參數量級 | 數億到 100 億以下 | 數百億到兆級 | 從「跑在哪」反推,不糾結數字 |
| 運作位置 | 手機、筆電、邊緣裝置、自架伺服器 | 雲端叢集為主 | 資料不能出門就往 SLM 靠 |
| 成本結構 | 硬體一次投入,邊際成本低 | 按 token 計費或重資本 | 用量越大,SLM 越划算 |
| 延遲 | 本地推論,不受網路影響 | 受網路與服務負載影響 | 即時與離線場景選 SLM |
| 能力上限 | 範圍內任務專精 | 廣泛知識與複雜推理 | 開放式任務交 LLM |
| 典型任務 | 摘要、分類、抽取、改寫、格式轉換 | 研究分析、創作、艱難推理 | 拿實際任務各跑一輪再定 |

表格是骨架,真正的判斷永遠回到任務的形狀。一個粗暴但有用的起手式:任務講得清楚、每天重複很多次、輸出可以直接驗收,就先試 SLM;任務連你自己都難描述邊界,先上 LLM。
模型是怎麼變小的?三種常見手法
「小」很少是憑空訓練出來的,多半是從大模型身上「做」出來的。三種手法常被疊加使用:知識蒸餾、量化、剪枝。
知識蒸餾:讓大模型當老師
機制白話版:老師模型不只告訴學生「答案是 B」,還把「我覺得 A 有三成可能、B 有六成」這種內部傾向一起教給學生。學生用小得多的參數量,去模仿老師的判斷分布,在特定任務上表現得逼近老師。這套方法的思想源頭,是 Geoffrey Hinton 團隊 2015 年的論文,十年來已經是訓練小模型的標配。
類比成老師傅帶徒弟最傳神:師傅把幾十年的判斷濃縮成可口傳的訣竅,徒弟學得快,但師傅見過的場面就是比較多。這也是蒸餾的邊界:徒弟在熟悉的工序裡又快又穩,遇到沒見過的狀況,沒有師傅那種見多識廣可以依靠。這條邊界,後面講限制時會再回來。
量化:把每個數字存小一點
模型的每個參數,原本用 16 或 32 位元的浮點數儲存;量化就是改用 8 位元、4 位元這種更小的格式來存。Google 開發者文件對量化的定義就是這件事:把權重從 32 位元浮點數,降到 8 位元之類的低位元表示。效果直接反映在體積上:4 位元約等於每參數 0.5 byte,一個 80 億參數的模型從 16GB 壓到 4GB 左右,就能塞進中等規格的筆電甚至手機。同一份文件的實測裡,2B 級模型下載下來約 1.3GB,已是多數手機應用能接受的體積。
量化有底線,但底線比多數人想像的低。類比是把無損音檔轉成 MP3:日常任務吃不到被壓掉的那些精度,要求極高的任務才會痛。Apple 的實際數字下一節會給,那個案例會讓你知道現在的工程甜點區落在哪裡。
剪枝:拆掉用不到的連結
訓練完的模型裡,有相當比例的權重幾乎不影響輸出。剪枝就是把這些低貢獻的連結直接移除,模型變小、變快,品質小幅折損;前面提過的 Google 開發者文件同樣收錄了這個手法。實務上三種手法常連著用:先蒸餾出小模型,再量化壓縮,必要時加上剪枝。你手機裡「看起來像大模型」的功能,多半是這條生產線的產物。

三種手法之外,還有一條更直接的路:不從大模型縮小,而是用高品質資料從頭訓練小模型。SmolLM3 就是這個路線的例子,30 億參數、11.2 兆 token 的訓練量,拚的是資料品質而不是參數規模。從頭訓練的成本與技術門檻高得多,通常是模型廠在做,不是應用端自己來;但它說明了一件事:小模型的強弱,關鍵在訓練資料的品質,不只是壓縮技術。
你的手機裡其實已經裝了小型語言模型
這不是未來式,是現在進行式。到 2026 年 8 月為止,三個主要平台,都把端側小模型做成了出廠標配。
Apple 用約 30 億參數,撐起日常 AI
Apple 在 2024 年 WWDC 公開的端側基礎模型技術報告寫得很明白:裝在 iPhone 上的語言模型約 30 億參數,用混合低位元量化把平均每個權重壓到 3.7 位元,在 iPhone 15 Pro 上每秒可生成約 30 個 token,第一個字的等待時間約 0.6 毫秒。真正難的請求,才會轉送到 Apple 伺服器上更大的模型處理。
2026 年 6 月,Apple 發表第三代基礎模型:標準端側的 AFM 3 Core 維持 30 億參數;更高階的 AFM 3 Core Advanced 總參數來到 200 億,靠稀疏架構每次請求只啟動 10 到 40 億,權重改放在快閃儲存裡。這透露了端側模型的演化方向:不再是單純追求更小,而是「總容量大、動用得少」。
Android 陣營:Gemini Nano 直接進系統
Google 這邊的名字叫 Gemini Nano。Android 官方開發文件把它定位成端側模型,由系統服務 AICore 負責排程,官方列出的賣點正是低延遲、隱私與離線可用:摘要、校對、改寫、影像描述這類功能,不必連網,也不必把資料送上雲端。對 App 開發者來說,這代表不必自己搬模型進應用程式,系統已經幫你養了一顆。
Windows 把門檻寫進規格:Copilot+ PC
PC 這邊更直接,把小模型的硬體需求寫成產品分類。微軟的 Copilot+ PC 開發文件載明:這個等級的機器必須配備每秒 40 兆次以上運算(40+ TOPS)的 NPU,符合資格的平台涵蓋 Snapdragon X Elite、AMD Ryzen AI 300、Intel Core Ultra 200V 等。NPU 是專門跑神經網路推論的處理器,40 TOPS 這個門檻,等於把「跑得動端側模型」變成採購規格。
對一般讀者的意義很簡單:2026 年買新筆電,包裝上的「AI PC」「Copilot+」不是行銷詞,是在告訴你這台機器有專用硬體在跑小模型。台灣市場上這類機種選擇不少,硬體取得早已不是門檻,真正的門檻是你要拿它做什麼。
為什麼平台要費工把模型塞進裝置?三個原因疊在一起:雲端推論的成本原本由平台吸收,塞進裝置後轉成消費者買硬體;隱私法規一年比一年嚴,資料不出裝置是最乾淨的設計;還有體驗,離線可用、回應即時,是雲端模型給不了的賣點。你感受到的是魔術,商業上其實是一筆算過的帳。

2026 年值得認識的小模型有哪些
講完原理看貨。截至 2026 年 8 月,開放權重的小模型主力大致落在 10 億到 40 億參數之間,競爭激烈到每幾個月就重排一次座次。以下五個系列,是挑模型時最常被拿出來比較的標的。
| 模型(推出時間) | 參數量 | 授權 | 一句話定位 |
|---|---|---|---|
| Microsoft Phi-4-mini(2025-02) | 38 億 | MIT | 128K 上下文的小鋼炮,另有效能取向的變體 |
| Google Gemma 4 E2B/E4B(2026-03) | 有效參數約 20 億/40 億 | Apache 2.0 | 邊緣優先的新一代,原生影像輸入,訓練涵蓋 140 多種語言 |
| Meta Llama 3.2 1B/3B(2024-09) | 10 億/30 億 | Llama 社群授權 | Meta 小尺寸開源模型的代表作,首日支援 Qualcomm 與 MediaTek |
| 阿里巴巴 Qwen3 小尺寸(2025-04) | 6 億/17 億/40 億 | Apache 2.0 | 尺寸最齊全的一家,可切換思考模式 |
| Hugging Face SmolLM3(2025-07) | 30 億 | Apache 2.0 | 11.2 兆 token 訓練,同級對比勝過 Llama 3.2 3B |

微軟的 Phi 系列一直是「以小博大」的代表:38 億參數的 Phi-4-mini 支援 12.8 萬 token 上下文,2025 年 7 月再推 Phi-4-mini-flash-reasoning,用混合架構把吞吐量往上拉。截至 2026 年 8 月中查閱,微軟官方 Phi 頁面上最新的開源成員仍是 Phi-4 系列,還沒有 Phi-5。
Google 的 Gemma 是更新最快的產品線之一:官方時間線上,Gemma 3 有 10 億到 270 億四種尺寸,針對手機的 Gemma 3n 最低 2GB 記憶體就能跑,2025 年 8 月還補上 2.7 億參數的超小尺寸。2026 年 3 月的 Gemma 4 直接標榜「每位元組最強的開源模型」,邊緣尺寸採 Apache 2.0,原生訓練涵蓋 140 多種語言,家族累計下載超過 4 億次。Gemma 4 與 Google 旗艦 Gemini 3 同源技術打造,對 Gemini 家族有興趣可以看 Gemini 3.6 Flash 的完整解析。
Meta 的故事剛好相反。Llama 3.2 的 1B 與 3B 是 2024 年 9 月發布的邊緣模型,支援 12.8 萬 token 上下文,發布當天就登上 Qualcomm、MediaTek 與 Arm 平台。但到此為止:之後的 Llama 4 轉向 109B 起跳的混合專家架構,到 2026 年 8 月,Meta 沒有再推出新的小尺寸開源模型,3.2 成了絕響。
還有兩個系列補上光譜的兩端。阿里巴巴的 Qwen3 小尺寸從 6 億到 40 億一路排開,全部 Apache 2.0,2026 年 3 月第三方評測追蹤到 Qwen3.5 的小模型(8 億到 90 億)已經上架。Hugging Face 自家的 SmolLM3 用 11.2 兆 token 的訓練量,在同級對比中勝過 Llama 3.2 的 3B 版本,也證明資料品質與訓練量比單純堆參數更能決定小模型的好壞。
挑模型的時候,授權跟參數一樣值得看。MIT 與 Apache 2.0 是寬鬆授權,商用與修改的限制少;Llama 的社群授權是自訂條款,商用前要讀過它的限制條文,特別是用戶規模達到一定量的服務。這些細節平常沒人看,出問題的時候才會被翻出來。
什麼時候該用 SLM?先問四個問題
模型不是信仰,是工具選擇。四個問題問完,答案通常自己浮出來。
- 任務有沒有明確邊界?摘要、分類、抽取、改寫、格式轉換,這類輸入輸出都說得清楚的任務,是小模型的主場。
- 用量有多大?每天幾萬次的呼叫,與每週幾次的諮詢,成本結構完全不同。量大時,單位成本的差距會被乘到難以忽視。
- 資料能不能出門?個資、病歷、營業祕密、還在申請中的專利文件,只要答案是不能,端側或自架的 SLM 就自動進入候選名單。
- 延遲與離線是不是硬條件?產線上的即時判讀、車用環境、網路不穩的現場,等雲端回應就是在等風險。
四個問題裡有三個答「是」,SLM 值得優先評估;三個以上答「否」,別勉強,直接上 LLM。落在中間的,做分流。

舉個具體情境。電商客服每天幾千封信,八成是查訂單、問退貨這類固定題型:邊界明確、用量大、信裡有個資、要即時分派,四個問題全中,這種就該讓 SLM 處理第一關。剩下兩成情緒複雜或規則邊緣的個案,連同客訴升級與公關風險,交給大模型或真人接手。多數導入失敗的原因不是選錯模型,是一開始就想用一顆模型解決所有的信。
讓大小模型分工,是更常見的做法
2026 年更成熟的姿態不是二選一。NVIDIA 研究團隊 2025 年的論文提出一個立場:代理式 AI 裡的多數任務窄而重複,解析信件、摘要、呼叫工具這類工作,小模型「夠強、更合適、也更經濟」;需要通用對話能力時,再喚起大模型。白話講:大模型負責拆題與把關,小模型負責跑量。

市場調查機構的預測指向同個方向:Gartner 估計到 2027 年,企業使用小型任務專屬模型的比例,將是通用大型語言模型的三倍。預測不是保證,但它說明了一件事:選型的問題,正在從「有沒有接大模型」轉變成「這個任務該配多大的模型」。
小模型的真實限制:三件它做不好的事
只講優點的文章你已經看過太多。三個限制,每個都會直接影響導入結果。
廣度:書讀得少,冷門問題先陣亡
微軟 Azure 詞典有個傳神的比喻:大型模型像從龐大媒體庫取材,小模型像只從一小櫃專業書取材。訓練資料少了幾個數量級,冷門事實、長尾詞彙、多語混用,都是小模型先倒下的地方。導入前,拿你自己領域的長尾問題打 20 題,比看任何排行榜都準。
深度:多步推理會斷鏈
需要把五個條件串起來的推理、需要跨文件對照的分析,小模型的錯誤率明顯上升。微軟官方文件也把「穩健且一致」列為大型模型的強項,反過來讀,就是小模型的弱項。實務上的分工線:單步、可驗收的任務交小模型;要串多步、錯一步就全盤重來的流程,交大模型,或加上人工檢查點。
幻覺:不會比較少,只是換個方式錯
「小模型幻覺比較少」是流傳很廣的說法,但到 2026 年 8 月,沒有任何一份主要官方文件或研究做出這種保證。比較可信的敘述是:領域微調過的小模型,在熟悉的範圍內可以更準;一旦踏出訓練分布,小模型往往比大模型更脆,因為它沒有冗餘的知識可以依靠。
所以正確的問題不是「哪種模型不會亂講話」,而是「輸出有沒有被驗收」。摘要附出處、分類給信心分數、關鍵欄位抽查,這些機制比模型大小更能決定上線後的可靠度。
講一個驗收的具體樣子:讓小模型摘要客服信時,要求每段摘要標上原文的段落編號,抽查人員只核對標號對不對得上;分類任務就要求輸出信心分數,低於門檻的自動轉人工。這些設計不花俏,但它們才是「幻覺變少」的真正來源,跟模型大小沒有直接關係。

台灣讀者要留意三件事
台灣語境下,有三個實際問題值得單獨拿出來講。
繁體中文能力,規格表不會告訴你
Gemma 4 官方說原生訓練涵蓋 140 多種語言,但沒有逐語言的成績單,「涵蓋」不等於「繁中表現好」。開源小模型的繁中能力差異很大,而且與參數量沒有必然關係。評估方式很土炮但有效:準備 20 題你自己領域的繁中真實任務,改寫客服信、抽取出貨單欄位、摘要繁中新聞都行,讓候選模型全部跑一遍再肉眼比對。這 20 題的結果,比任何規格表都貼近你的場景。還有個現實要認:主流排行榜的題目以英文為主,繁中表現在榜上大多缺席,這更說明實測沒有捷徑可繞。
硬體與實作資源比你想的近
前面提過 Copilot+ PC 把 NPU 門檻寫進規格,台灣各大品牌通路都有貨。想再進一步自己玩,台灣創客圈的資源也不少,例如 MakerPRO 介紹如何在邊緣裝置跑 TinyLlama 的實作文章,講的就是 11 億參數等級的超輕量模型。從「買得到的硬體」到「跑得起來的工具」,這段距離在 2026 年已經很短。
產業面:邊緣 AI 正對上台灣的強項
MIT Technology Review 把小型語言模型選進 2025 年十大突破技術,台灣的討論也早就在進行。人工智慧科技基金會的知勢專欄在 2025 年初集結了半導體與電信業資深人士的觀點,共同指向一件事:小模型讓邊緣裝置長出推理能力,而邊緣硬體正是台灣產業熟悉的戰場。經濟部的產業科技評析也以邊緣小語言模型的應用與前景做過專文討論。
對在硬體供應鏈、製造業或系統整合業的讀者,這個訊號的意義是:AI 應用的主戰場正在從雲端轉向裝置端,而裝置端是台灣產業鏈累積了幾十年優勢的地方。

三個常見誤解,先幫你拆掉
誤解一:小模型就是比較差的模型
這句話把「不同取捨」誤讀成「全面劣化」。事實是同尺寸內的競爭異常激烈:Hugging Face 的 SmolLM3 只有 30 億參數,同級對比勝過 Llama 3.2 的 3B;微軟 Phi 系列多年的賣點,正是用 38 億參數打更大模型的場子。在範圍明確的任務上,選對小模型,結果不輸,成本省一個量級。
換個角度想:參數量像員工人數,任務像工作量。請一萬人的公司影印一份文件不會比較快;同樣地,把「你好」翻成英文,30 億參數與 300 億參數的差距你感覺不出來。差異只在你真的需要深度與廣度的任務上出現。
誤解二:參數越少就越省
半對。省的是每一次推論的成本,但建置成本不會消失:要微調就要資料與算力,要蒸餾先得有一個大模型當老師,要自架就要有人維運。「越少越省」在帳單上成立,在專案總成本上要看條件。
誤解三:本地跑等於免費
本地跑省下的是按量計費的雲端帳單,但硬體折舊、電力、模型更新、資安防護都是真實成本。比較務實的講法:本地 SLM 把成本從「變動費用」換成「固定投資」,用量越大、投資攤提越快;用量小,這筆投資可能永遠攤不完。
想動手試,三條入門路線
從輕到重,三條路線,各取所需。
路線一:先用你已經有的裝置
成本最低的起手式。把 iPhone 的 Apple Intelligence、Android 的智慧回覆、Copilot+ 筆電的端側功能打開,再故意開飛航模式,測試哪些功能還活著:還活著的,就是端側小模型在跑。先建立「什麼任務端側做得到」的手感,再談任何導入。
路線二:自己跑一個開源模型
想摸到模型本身,用 Ollama 這類工具最省事:官方定位就是在你的電腦與雲端跑開放模型,免費起步,一行指令就能拉一個 Gemma 或 Qwen 的小尺寸下來跑。硬體從 10 億到 30 億參數的量化版本開始,8GB 記憶體等級的筆電就有機會跑得動;跑不動就換更小的,別跟硬體賭氣。
路線三:走雲端 API 再分流
不想管硬體,就走 API。Phi 系列在 Azure AI Foundry 上有託管服務,各雲端平台也大都收了常見的開源小模型。建議做法:準備一組固定的測試任務,讓候選的 SLM 與 LLM 各跑一輪,比品質、比速度、比成本,再決定哪些任務分流給小模型。這一步做完,你對「該用哪個」的答案,會比任何文章都具體。
三個動作,今天就能做:打開手機,數一數哪些 AI 功能離線還能用;挑一個 30 億參數級的模型,在筆電上跑起來;拿你工作裡真實的重複任務,讓小模型與大模型各做一次。做完這三件事,SLM 對你不再是新聞裡的名詞,而是一個算得出損益的選項。

常見問題
小型語言模型(SLM)的定義是什麼?多少參數算小?
小型語言模型是參數量明顯小於主流大型模型、小到能在手機與筆電等終端裝置直接運作的語言模型。參數門檻沒有公訂標準:微軟官方文件以 100 億參數為分界,Azure 詞典則用「數億」描述,實務上 10 億到 100 億都常被稱為小模型。與其記數字,不如記「跑得動的硬體」:手機等級約 20 億有效參數以下,筆電約 70 到 80 億的量化版本。
SLM 會取代 LLM 嗎?
方向不是取代,是分工。需要廣泛知識、多步推理與開放式生成的任務,大型模型仍有明顯優勢;範圍明確、高用量、隱私敏感的任務則持續轉向小模型。Gartner 預測到 2027 年,企業使用小型任務專屬模型的比例將是通用 LLM 的三倍,講的是用量結構改變,不是大模型退場。
SLM 跟 LLM 可以一起用嗎?
可以,而且這是 2026 年常見的架構。典型做法是大模型當規劃者,負責拆解任務與驗收結果;小模型當執行者,負責跑重複的子任務。NVIDIA 2025 年的研究立場就是:代理式系統裡多數任務窄而重複,用小模型更經濟,需要通用能力時再喚起大模型。
手機真的跑得動語言模型嗎?
跑得動,而且已經上市兩年多。Apple 2024 年公開的端側模型約 30 億參數,在 iPhone 15 Pro 上每秒生成約 30 個 token;Google 的 Gemini Nano 由 Android 系統服務排程,主打離線與隱私。Google 針對手機的 Gemma 3n E2B,官方標示最低 2GB 記憶體就能跑。
小型語言模型的幻覺有比較少嗎?
沒有證據顯示這是真的。比較可信的版本是:領域微調過的小模型,在熟悉範圍內表現更準,但踏出訓練分布後,往往比大模型更脆弱。幻覺的控制靠任務設計與輸出驗收,例如附出處、給信心分數、關鍵欄位抽查,不是靠模型變小。
小型語言模型是免費的嗎?
多數開源模型的權重可以免費下載,Phi 系列採 MIT,Gemma 4 與 Qwen3 採 Apache 2.0,但「模型免費」不等於「使用免費」:自己跑要硬體與電力,走雲端要按量計費,商業使用還要看授權條款,例如 Llama 的社群授權有自訂的限制。總成本取決於用量與部署方式。
自己跑一個小模型需要什麼硬體?
入門建議從 10 億到 30 億參數的量化版本開始,8GB 記憶體等級的筆電通常就有機會;要舒服地跑 70 到 80 億參數,建議 16GB 起跳,再往上就得看顯卡。工具面用 Ollama 這類方案,安裝後一行指令就能把模型拉下來跑。跑不動就換更小的,先建立手感比較重要。
小模型的繁體中文能力好嗎?
沒有統一答案,必須實測。官方規格通常只給涵蓋語言數,例如 Gemma 4 的 140 多種,但不保證繁中品質,而且繁中表現與參數量沒有必然關係。最可靠的做法,是準備 20 題自己領域的繁中真實任務,讓候選模型全部跑一輪再比對。
