認識 AI 模型:從 token 到自架,18 篇讀懂模型的通用知識
不需要變成研究員也能系統理解 AI 模型。這個系列從你看得見的東西(token、context window)開始,一路走到自架開源模型,18 篇覆蓋選模型、讀 benchmark、算成本需要的所有基礎。
給還不熟 AI 模型的讀者的入門系列:概念、名詞與怎麼挑一個模型來用。
不需要變成研究員也能系統理解 AI 模型。這個系列從你看得見的東西(token、context window)開始,一路走到自架開源模型,18 篇覆蓋選模型、讀 benchmark、算成本需要的所有基礎。
模型不讀字,讀 token——一個中文字通常是 1-2 個 token,一個英文字通常是 1-3 個。Context window 是模型一次能看的 token 上限。推論是用模型,訓練是教模型;你每天在做的是推論。
模型不是按字數收費,是按 token 收費。BPE 演算法從字元開始,反覆合併最常出現的相鄰配對來建詞表。英文 'understanding' 可能是 1-2 個 token,但中文「理解」可能要 2-3 個——同樣的意思,中文就是比較貴。
模型不懂文字,只懂數字。Embedding 把每個 token 對應到一組幾百維的向量,意思相近的詞在向量空間裡距離相近。這是搜尋、RAG、分類背後共用的基礎機制。
模型每次預測下一個 token 時,會給每個候選詞一個機率。Loss function 衡量這個機率分佈跟正確答案差多遠——差越多,loss 越高,模型就知道自己錯得越離譜。Cross-entropy 是最常用的算法,perplexity 是它的直覺版。
模型透過 loss 知道自己錯多少,透過梯度知道往哪邊調。梯度下降就是反覆做三件事:算 loss、算梯度、調參數。Learning rate 決定每步調多大——太大會跳過最佳解,太小訓練到天荒地老。
Transformer 的核心是 self-attention:對每個 token,模型算出它跟其他所有 token 的相關程度,然後按權重加總。這讓模型能跨越距離抓到「it 指的是 cat 不是 mat」這種關係,也是它處理長文的基礎。
所有 LLM 都經過三階段訓練:預訓練讀完網路學會語言、SFT 用示範對話學會格式、RLHF 用人類偏好學會什麼回答比較好。Base model 到 chat model 的差距,就是後兩個階段做的事。
Scaling laws 說 loss 跟參數量、資料量、算力之間有可預測的冪次關係。Chinchilla 論文的關鍵發現:大多數模型都太大、訓練資料太少——同樣的算力預算,訓練一個較小但吃更多資料的模型反而更強。這改變了整個產業的訓練策略。
2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。
模型發布時貼的 benchmark 數字有三個常見陷阱:只秀贏的(cherry-picking)、訓練資料混入考題(contamination)、大家都考 90 分以上就沒鑑別力(saturation)。最抗操弄的訊號是 Chatbot Arena 的 Elo 排名——真人盲測投票,模型廠商無法控制題目。
每個模型發布都帶 benchmark 數字,但同一個模型在不同 harness 上可以差 20 分、SWE-bench Verified 的 32% 驗證器判斷有誤、DeepSWE 113 題讓多數模型掛零。這篇拆解六個主要 coding benchmark 各自測什麼、哪些容易灌水、讀者該看哪個。
2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。
資料常更新、需要引用來源 → RAG。需要統一風格、要跑在小裝置上 → fine-tuning。實務上很多系統兩者都用:fine-tune 一個懂你領域語言的小模型,再用 RAG 補上最新資料。
70B 模型原本需要 140GB VRAM,但量化到 4-bit 只需要 ~35GB,再用 llama.cpp 的部分卸載就能在消費級硬體上跑。GGUF 格式的命名規則(Q4_K_M、Q5_K_S)告訴你精度和大小的取捨。KV cache 是長對話變慢的主因。
AI 的「開源」不等於軟體的開源。MIT 和 Apache 2.0 真的隨便用;Llama License 超過 7 億月活要另外談;舊版 Gemma 授權 Google 可以片面修改(Gemma 4 已改 Apache 2.0)。這篇按授權類型整理你能做什麼、不能做什麼。
同一個模型透過不同管道存取,價差可以到 2-5 倍。直連最簡單、聚合器(OpenRouter)最靈活、雲端平台(Bedrock/Vertex)最適合企業。這篇用 2026 年 8 月實際價格做橫向比較,附選擇決策樹。
2026 年開源模型在 coding benchmark 追平閉源,但自架不只是選模型——vLLM 適合高併發生產服務、SGLang 在前綴重用場景快 29%、Ollama 是本地開發首選、llama.cpp 吃最少資源。A100 雲端租金約 $1.4-2.2/hr,自架損益兩平點大約在每月 100M tokens。