從零訓練一個 LLM:從 $0.4 到 65B 的專案光譜
開源社群把「從零訓練 LLM」的門檻壓到了驚人的低:MiniMind 用約 $0.4、單張 3090 兩小時就能跑完從 PreTrain 到 RL 的完整流程,另一端 OLMo 3 與 LLM360 K2 把 65B 模型的訓練資料、程式碼、每個階段的 checkpoint 全部公開。這個系列用 11 篇逛完從 $0.4 到 65B 的專案光譜,並標註這份地圖覆蓋不到的地方。
從零開始訓練一個語言模型的實作紀錄:資料、tokenizer、架構、訓練與評估的每一個決定。
開源社群把「從零訓練 LLM」的門檻壓到了驚人的低:MiniMind 用約 $0.4、單張 3090 兩小時就能跑完從 PreTrain 到 RL 的完整流程,另一端 OLMo 3 與 LLM360 K2 把 65B 模型的訓練資料、程式碼、每個階段的 checkpoint 全部公開。這個系列用 11 篇逛完從 $0.4 到 65B 的專案光譜,並標註這份地圖覆蓋不到的地方。
MiniMind 是一個從零開始訓練 LLM 的開源專案:64M 的 Dense 模型與 198M-A64M 的 MoE 模型,單張 3090 約 2 小時、約 3 元人民幣就能跑完 Pretrain → SFT → LoRA → DPO → PPO/GRPO/CISPO → Agentic RL 的完整流程。所有核心演算法用 PyTorch 原生實作,不依賴高階封裝。
Karpathy 三代教學專案縱覽:nanoGPT(2022,各約 300 行重現 GPT-2 124M)、llm.c(純 C/CUDA 訓練)、nanochat(2025-10,一個 speedrun.sh 從 tokenizer 訓到 WebUI)。100 美元、4 小時在 8×H100 上訓出能對話的模型;GPT-2 級能力到 2026 年初已壓到約 2 小時、48 美元。
拆解三個中文圈從零訓練 LLM 的開源專案——baby-llama2-chinese(218M、634 億 tokens)、ChatLM-mini-Chinese(0.2B T5、1,023 萬條對話)、Steel-LLM(1.12B、1 兆 tokens、8 個月)——比較語料策略、tokenizer 決策與社群生態;誠實呈現評測:baby-llama2 在 MiniMind 的橫評中 21 分墊底,ChatLM 知識紮實(62 分)但程式能力弱。
YuLan-Mini 是中國人民大學 AI Box 實驗室用 48 張 A800 訓出來的 2.4B 開源模型:只餵 1.08T tokens,MATH-500 拿 37.8、HumanEval 64.0,數學與程式能力壓過用了 7T–18T tokens 的 Qwen2/Qwen2.5 同級模型。它公開的不是口號,是每個階段的資料配比、退火前的 optimizer 狀態、連消融實驗的 W&B logs。
從零訓練只在三種情況成立:你要學習訓練本身、你有開放模型沒見過的 10B+ 乾淨語料、或你需要全透明的訓練過程做研究。否則微調或 RAG 幾乎總是更便宜的答案。這篇把系列走過的主要路線收斂成一張成本梯度表與決策樹。
兩個國家級專案展示了從零訓練的另一種動機:瑞士的 Apertus 用 15T tokens、1,000+ 語言與嚴格的 opt-out 個資過濾對齊 EU AI Act;日本的 LLM-jp 由 NII 主導,2026 年 4 月的 LLM-jp-4 在 12T tokens 上訓練出多項 benchmark 超越 GPT-4o 的模型。它們回答的問題和效能路線不同:不是「跑得快」,而是「主權與合規下能訓出什麼」。
OpenELM 用 layer-wise scaling 把參數偏向靠近輸出的層,1.08B 參數、1.5T tokens 在 LLM360 平均分數上超越吃了 3T tokens 的 OLMo 1.2B(+2.36%);MiniCPM 用三階段解凍(先 Resampler、再視覺編碼器、最後全開)從零訓練多模態小模型,MiniCPM-V 4.5 以 8B 達到 VideoMME 30B 以下 SOTA,再靠 4-bit 量化把 fp16 的 16–17GB 記憶體壓到約 5GB。
LitGPT(Lightning AI,約 13,600 stars,Apache 2.0)把 Llama 3、Qwen2.5、Phi 4 等 20+ 個 LLM 逐一從零重寫成無抽象層的單檔實作,附 pretrain / finetune / evaluate / serve 完整命令列;1.1B 參數、3T tokens 的 TinyLlama 就是用它的程式碼訓出來的。這篇拆解它與 MiniMind 的差異、實際用法與限制。
系列實作篇:在 RunPod 租一張 RTX 3090(Secure Cloud $0.5/hr、Community Cloud $0.22/hr),照 README 步驟跑完 MiniMind 的 pretrain(約 1.21h)+ SFT(約 1.10h),總成本約 $0.55–1.50 美元,就能在終端機跟自己從零訓出來的 64M 模型對話。
「開源 LLM」其實是一條光譜:只開權重(Llama)→ 權重加資料(多數 fully open 專案)→ 連資料順序、中間 checkpoint、訓練日誌都開(LLM360 K2、OLMo 3 的 model flow)。這篇拆解兩個把透明度推到極致的專案:OLMo 3 在 2025 年 11 月放出首個全開的 32B thinking 模型,K2 則是首個 65B 級、連 optimizer states 都公開的模型。