Skip to content
所有標籤

#diffusion-model

7 篇文章
tech deep-dive AI 模型家族

FLUX——Stable Diffusion 原班人馬出走後造出的圖像模型家族,從 12B 到 Self-Flow 世界模型

FLUX 是 Black Forest Labs 的圖像模型家族——2024 年 8 月由 Stability AI 的 Stable Diffusion 原班人馬創立後首發,12B rectified flow transformer 一戰成名;兩年後家族已長成五層:klein 4B($0.014 起、家族新一代唯一的 Apache 2.0)/9B、pro($0.03)、flex($0.05)、max($0.07、可即時搜尋網路 grounding),外加 32B 開放權重的 dev;2026 年 8 月更用 FLUX 3 把影片+同步音訊+機器人動作收進同一個 Self-Flow 架構。這篇追蹤從 FLUX.1 到 FLUX 3 的演化、授權三層制與選型建議。

ai deep-dive AI 頂會導讀

2021 AI 頂會導讀:機器學習篇

2021 年是 diffusion model 超越 GAN、自監督學習理論突破、RL 評估方法論覺醒的一年。NeurIPS 收了 9,122 篇投稿創當時紀錄,ICLR 的 Score-Based Generative Modeling 論文日後成為整個 diffusion 生態的理論基石,ICML 則在優化理論與自監督學習動力學分析上交出紮實貢獻。

ai deep-dive AI 頂會導讀

2021 AI 頂會在收什麼題目:Transformer 擴散、自監督學習與 Diffusion 的起點

2021 年是 AI 頂會的分水嶺:Transformer 從 NLP 全面入侵 CV 與時序領域,自監督學習成為各會議最熱門關鍵詞,Diffusion Model 拿下 ICLR Outstanding Paper 但還沒有人意識到它會取代 GAN——而 GNN 和 Federated Learning 正處於論文量的歷史高峰,之後開始走下坡。

ai deep-dive AI 頂會導讀

2022 AI 頂會導讀:機器學習篇

2022 年是 diffusion model 登上頂會舞台中央、Chinchilla scaling laws 改寫大模型訓練範式、Chain-of-Thought 讓推理成為可提示能力的一年。NeurIPS 破萬篇投稿,13 篇 Outstanding Paper 裡有 3 篇跟 diffusion 直接相關,Chinchilla 和 data pruning 兩篇挑戰了『大就是好』的信條。ChatGPT 年底發佈前夜,所有拼圖都在這一年的頂會上各就各位。

ai deep-dive AI 頂會導讀

2022 AI 頂會在收什麼題目:Diffusion 爆發、Chain-of-Thought 與 ChatGPT 前夜

2022 年是 AI 頂會的轉折年:Diffusion Model 從冒頭變成主流(NeurIPS 兩篇 Outstanding Paper),Chinchilla 改寫 scaling laws 的遊戲規則,Chain-of-Thought 證明大模型能推理,InstructGPT 用 RLHF 讓語言模型學會聽話——而這一切在年底 ChatGPT 上線後瞬間從學術議題變成全球新聞。

ai deep-dive AI 頂會導讀

2024 AI 頂會導讀:機器學習篇

2024 年是 ML 頂會投稿量爆炸的一年:NeurIPS 收到 15,671 篇創歷史紀錄,ICML 和 ICLR 也分別突破九千和七千。研究主題從「把模型練更大」轉向「推論時怎麼花算力更聰明」——test-time compute scaling 成為年度最重要的新方向。Best Paper 層面,VAR 用 next-scale prediction 在影像生成上超越 diffusion、Rectified Flow 成為 Stable Diffusion 3 的理論基礎、ICLR 首次頒發 Test of Time Award 給 VAE 原論文。

ai deep-dive AI 頂會導讀

2025 AI 頂會在收什麼題目:Agent 爆發與 Reasoning 革命

2025 年 AI 頂會的兩個最強訊號:reasoning 論文從 47 篇暴增到 216 篇(4.6 倍)、agent 相關關鍵詞合計超過 150 篇(4.3–11 倍成長)。Diffusion model 已從「爆發」進入「基礎設施」階段,RAG 以五會議全覆蓋的罕見擴散速度成為企業 AI 的主流架構,而 state space model 和 world model 正複製 2020–2021 年 Vision Transformer 的早期軌跡。純 prompt engineering 論文開始遭遇 reviewer fatigue。