Skip to content

Ornith:小團隊用自我改進 RL 做出的開源 Coding 黑馬

2026年8月26日 1 分鐘
TL;DR DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。
目錄
  1. 團隊與定位
  2. 訓練方法:從 Self-Scaffolding 到 Self-Improvement
  3. 模型家族規格
  4. Benchmark 對比
    1. 旗艦 397B vs 閉源頂尖
    2. 35B-A3B:真正的驚喜
    3. 9B:手機上的 Coding Agent
  5. 實際使用
  6. 值不值得關注
  7. 參考資料

🌏 English version

DeepReinforce 不是大廠。不是阿里、不是 Meta、不是 Google——是一個專注在 agentic coding 和強化學習的小團隊。但他們在 2026 年 8 月發布的 Ornith 1.5 家族,在多個 coding benchmark 上追平甚至超越了 Claude Opus 4.8,而且全部 MIT 授權開源。這篇整理他們怎麼做到的、值不值得關注。

團隊與定位

DeepReinforce(官網 deep-reinforce.com、產品頁 ornith.ai)的核心主張是:與其手工設計 agent 的 scaffold 和訓練資料,不如讓模型自己學會怎麼搭 scaffold、自己產出訓練題目。

他們不從頭預訓練基礎模型——Ornith 建立在 Qwen3.5 和 Gemma 4 之上,透過繼續預訓練(CPT)、中間訓練和後訓練做出基底,再用自研的 self-improvement RL 框架做最後一哩。這個策略讓小團隊不需要幾千張 GPU 也能做出有競爭力的模型。

訓練方法:從 Self-Scaffolding 到 Self-Improvement

Ornith 的訓練方法是它最有意思的部分。

Ornith 1.0 引入 self-scaffolding:模型不只學解題,還學怎麼搭建解題用的 scaffold(工具呼叫策略、程式碼結構、推理框架)。scaffold 和解題 rollout 透過 GRPO 聯合優化。

Ornith 1.5 把這個迴圈擴展成完整的 self-improvement loop,加入了三個聯合優化的階段:

  1. Task Generation——模型自己出題。依據 validity(題目合理)、frontier difficulty(剛好在模型能力邊緣)、novelty(不重複已見過的題)三個訊號給獎勵
  2. Scaffold Construction——模型為每道題設計解題 scaffold
  3. Solution Rollout——模型在 scaffold 裡執行解題,rollout 的獎勵回傳給前兩個階段

依 Ornith 官方技術報告所述:「Repeated over training, this creates a closed self-improvement loop in which stronger policies enable the generation of harder and more informative tasks, evolving scaffolds discover better ways to elicit the model's capabilities, and higher-quality rollouts provide increasingly effective learning signals.」

簡單說:模型越強 → 出的題越難 → scaffold 越聰明 → 解題品質越高 → 模型更強。這個正向循環不依賴人工標註的資料集,理論上可以持續改進。

模型家族規格

Ornith 1.5 有三個規模,全部 MIT 授權、權重公開在 Hugging Face

模型架構總參數每 token 啟用特點
Ornith 1.5-397BMoE397B未公開旗艦,追平閉源頂尖
Ornith 1.5-35B-A3BMoE35B~3B效率怪物,同量級王者
Ornith 1.5-9BDense9B9B有量化版可跑手機

9B 版本提供 Ornith-1.5-9B-Mobile 量化版,官方表示可以部署在 iPhone 和 Android 裝置上。

Benchmark 對比

以下數據來自 Ornith 官方技術報告,所有 Ornith 成績為五次獨立測試的平均值。

旗艦 397B vs 閉源頂尖

BenchmarkOrnith 1.5-397BClaude Opus 4.8GLM-5.2DeepSeek-V4-Flash
Terminal-Bench 2.186.185.082.782.7
SWE-bench Verified86.085.8
DeepSWE56.059.046.254.4
GPQA Diamond92.8
BrowseComp86.6

397B 在 Terminal-Bench 和 SWE-bench 上略贏 Claude Opus 4.8,DeepSWE 則小輸。整體而言與最強閉源模型打成平手——對一個開源模型來說這是很高的水準。

35B-A3B:真正的驚喜

35B-A3B 是整個家族最值得關注的成員。每個 token 只啟用約 3B 參數,卻在 coding benchmark 上全面領先同量級甚至更大的模型:

BenchmarkOrnith 1.5-35BQwen3.6-35BGemma 4-31BMuse Glimmer-30BQwen3.5-397B
SWE-bench Verified79.073.452.076.076.4
SWE-bench Pro59.649.535.7
SWE-bench Multilingual71.467.269.3
Terminal-Bench 2.1 (Terminus-2)67.852.542.151.753.5
Terminal-Bench 2.1 (Claude Code)68.549.243.4
DeepSWE22001
NL2Repo46.229.436.8
GPQA Diamond89.286.088.4

幾個重點:

  • SWE-bench Verified 79.0 是同量級(30B-35B)唯一破 79 的模型,甚至超越 11 倍大的 Qwen3.5-397B(76.4)
  • DeepSWE 22 vs 0——同量級的 Qwen3.6-35B 和 Gemma 4-31B 在這個 benchmark 上直接掛零,差距最為懸殊
  • 在純推理(HLE with tools)上,35B 的 33.4 仍落後 Qwen3.5-397B 的 48.3,規模差距在通用推理上還是存在

9B:手機上的 Coding Agent

BenchmarkOrnith 1.5-9BQwen3.5-9B
Terminal-Bench 2.146.221.3

9B 在 Terminal-Bench 上超過 Qwen3.5-9B 兩倍以上。官方稱 9B 的表現已經追平甚至超越 Gemma 4-31B 和 Qwen 3.6-35B 這些大好幾倍的模型。

實際使用

Ornith 相容 OpenAI API 格式,可以用 vLLM 或 SGLang 部署。依 GitHub repo 說明,可以直接接入 Claude Code、OpenCode 等 agentic coding CLI:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
    model="Ornith-1.5-35B-A3B",
    messages=[{"role": "user", "content": "Fix the bug in this function..."}]
)

35B-A3B 因為每 token 只啟用 3B 參數,推論成本遠低於同分數的模型。社群已有人在單張 A100 上跑 35B 本地部署的實測報告。9B 量化版甚至可以跑在消費級 GPU(12 GB 起)或手機上。

值不值得關注

值得,原因有三:

  1. 方法論的意義——self-improvement loop 不依賴人工標註就能持續改進。如果這條路可行,代表小團隊也能持續追趕甚至超越大廠的專有資料優勢
  2. 效率的示範——35B-A3B 用 3B 的推論成本做到 79 分的 SWE-bench,讓「自架開源模型做 agentic coding」從理論變成可行方案
  3. 完全開源——MIT 授權,權重、程式碼全公開,沒有「開源但不給商用」的限制

需要保留的地方:

  • Benchmark 數據來自 Ornith 自己的測試,獨立第三方大規模複現還在進行中
  • 通用推理能力(HLE、MATH)仍落後同規模閉源模型,Ornith 的強項集中在 coding 和 agentic 任務
  • 團隊規模小,模型的長期維護和迭代速度是未知數

參考資料