融資速報|Deep Cogito Series A $43M
Deep Cogito 完成 $43M Series A,由 TQ Ventures 領投,Benchmark、Nexus Venture Partners、Zscaler 等跟投,累計融資超過 $56M。這輪錢押的不是下一個前沿模型,而是「後訓練」本身能不能變成一門獨立、可對外銷售的生意。
Deep Cogito 完成 $43M Series A,由 TQ Ventures 領投,Benchmark、Nexus Venture Partners、Zscaler 等跟投,累計融資超過 $56M。這輪錢押的不是下一個前沿模型,而是「後訓練」本身能不能變成一門獨立、可對外銷售的生意。
2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。
第 8 講解釋預訓練模型如何經 instruction tuning、偏好資料與 RLHF 變成助理,再以 DPO 直接從勝負配對學習;每一步都把人的判斷轉成訓練訊號,也把偏差帶進模型。
第十五講把 post-training 拆成 imitation 與 optimization:SFT 從 instruction-response data 抽出預訓練已有能力,RLHF 用 pairwise feedback 跨過人類示範與偏好之間的落差;PPO 與 DPO 都逃不掉資料偏差、reward overoptimization 和 mode collapse。
08–12 組教材把 base model 變成可互動系統:預訓練決定基礎能力,post-training 改變行為,generation 與 evaluation 決定輸出如何被使用與判讀。