MoE 為什麼贏:從 Ornith 到 MiniMax,2026 年前沿模型都在用的架構
2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。
2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。
MiniMax 從消費級聊天 App 起家,M2.5 在 SWE-bench Verified 拿 80.2% 但 API 價格只有 Claude Opus 的 1/10-1/20;M3(456B 總量 / 45.9B 啟用)是首個在 SWE-bench Pro 突破 59% 的開源權重模型,還有 1M context。
DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。
DeepSeek 用 MLA + MoE 兩項架構創新把推論成本壓到業界最低,V4 Flash 以 13B 活躍參數跑出接近前端模型的品質,成為 OpenRouter 用量第一。這篇追蹤從 V1 到 V4 的演化、R1 推理線的分叉、以及每個版本該怎麼選。
GLM 是智譜 AI(Z.ai)推出的開源 LLM 家族,源自清華大學 KEG 實驗室。GLM-5.3(2026/08)在 coding benchmark 比前代提升 50%,CyberGym 84.5% 超過 Anthropic Mythos 5 與 OpenAI GPT-5.6 Sol,在 Artificial Analysis Intelligence Index 得分 60 與 Kimi K3 並列開源第一。它是目前唯一完全在華為昇騰晶片上訓練出的前沿開源模型。
Grok 是 xAI 的 LLM 家族,2023/07 成立、2024/03 以 314B MoE Apache 2.0 開源起手,兩年半迭代到 Grok 4.6(500K、$2/$6、四檔推理)與 2M 的 Grok 4 Fast;另有 Imagine 圖像/影片與 Grok Build 終端 coding agent——護城河在分發(X / grok.com / Tesla / Bedrock),而非單點模型能力。這篇追蹤 Grok 1→4.6 的演化、子線定位、定價與授權陷阱。
Kimi 是月之暗面(Moonshot AI)推出的 LLM 家族,以超長 context 起家。2026 年 7 月發布的 Kimi K3 是全球首個開源 3T 級模型——2.8T 參數、104B 活躍、1M context,在 Artificial Analysis Intelligence Index 得分 60 與 GLM-5.3 並列開源第一。其 Kimi Delta Attention 架構帶來 2.5 倍 scaling 效率提升。
Llama 是 Meta 推出的開源 LLM 家族,以企業部署量最大、生態最成熟聞名。Llama 4 Scout(10M context)和 Maverick(17B active / 400B total MoE)是目前的開源多模態標竿,但 Meta 已在 2026 年 4 月轉向閉源 Muse Spark——Llama 4 很可能是最後一個主要的開源 Llama,且授權不是真正的開源(Llama 4 Community License,月活超 7 億需另外授權)。
Mistral 是歐洲最成功的 AI 新創,以「更小、更快、更便宜」的策略和歐洲資料主權定位在 AI 市場殺出血路。Mistral Large 3 是歐洲最強的商用 LLM,Small 4 是 24B 級別的效率之王,Medium 3.5 則是專為 agentic coding 優化的 Modified MIT 開源模型。它的護城河不是技術規模,而是「歐洲合規」這張牌。
Qwen 是 HuggingFace 下載量最高的模型家族,尺寸從 0.8B 一路涵蓋到 2.4T。2026 年 8 月阿里首度開源 Max 級旗艦權重(Qwen3.8-2.4T-A95B),但授權換成了自訂條款而非慣例的 Apache 2.0;同期開源、筆電就能跑的原生視覺模型 Qwen3.8-27B 反而是新面孔裡唯一的 Apache 2.0。這篇追蹤 Qwen 從 2023 年到 3.8 世代的演化、開源線與商用線的分家邏輯,以及每一層該怎麼選。
2026 Q1 開源模型全面爆發:LLM 方面 GLM-5、Kimi K2.5、Qwen3.5 追上閉源;Embedding 和 Reranker 由 Qwen3 和 BGE 主導;語音有 Voxtral TTS 和 Whisper V3;圖像有 FLUX.2;影片有 Wan 2.2 追平 Sora。這篇是完整導覽地圖。