2024 年 8 月,四個從 Stability AI 出走的德國研究者——Robin Rombach、Patrick Esser、Andreas Blattmann、Dominik Lorenz——在 Freiburg 成立了 Black Forest Labs。這不是普通團隊:Rombach 是 Latent Diffusion 論文的第一作者,Stable Diffusion 背後的架構就出自這批人之手。母公司財務動盪、核心研究員集體出走,然後在同月把首款模型 FLUX.1 丟上市場,12B 參數直接把自家老東家的後繼版本打下去。這是 AI 模型家族系列的第十三篇,追蹤這家「德國復仇者」如何用兩年時間從一款開源模型長成涵蓋圖像、影片、機器人的視覺智慧公司。
怎麼解讀文中引用的 benchmark 數字,請參考AI 模型評測來源指南。這篇是AI 模型用途總覽系列第十三篇家族深度介紹。
家族演化時間線
| 版本 | 發佈 | 關鍵事實 |
|---|---|---|
| BFL 創立 | 2024-08 | Freiburg 起家,a16z 領投種子輪 $31M |
| FLUX.1 schnell/dev/pro | 2024-08 | 12B rectified flow transformer;schnell Apache 2.0、dev 非商用、pro API 獨佔 |
| Series A | 2024 下半年 | a16z 領投約 $100M、估值 $1B——金額未經官方確認(TechCrunch 引 sources 說法,2024-09 報導) |
| FLUX1.1 [pro] | 2024-10 | 六倍速度提升;11 月再加 Ultra/Raw 模式,輸出上看 4MP |
| FLUX.1 Kontext | 2025-05 | 文字+圖像上下文編輯線開張,Kontext [dev] 同年 6 月開放權重 |
| FLUX.2 pro/flex/dev | 2025-11-25 | 32B 架構、Mistral 3 24B VLM 文字編碼器、最多 10 張參考圖、原生 4MP(官方 blog、GitHub) |
| FLUX.2 [max] | 2025-12-16 | 頂級檔位上線,grounded generation 即時網路搜尋 |
| Series B | 2025-12-01 | $300M、估值 $3.25B,Salesforce Ventures 與 AMP 共同領投,NVIDIA/Figma Ventures/Canva 跟投 |
| FLUX.2 [klein] | 2026-01-15 | 4B(Apache 2.0)與 9B(非商用),13GB VRAM 起、消費級 GPU 亞秒生成 |
| FLUX 3 發表 | 2026-07-23 | Self-Flow 多模態基座:圖像+20 秒影片+同步音訊+機器人動作;FLUX-mimic 已在 Audi 產線測試(公告) |
| FLUX 3 Video GA | 2026-08-04 | 20 秒 FHD(1920×1088)24fps 單次生成、原生唇同步音訊、Draft 預覽模式(發佈文);FLUX 3 Image 與開放權重的 Dev 承諾年內跟進 |
兩年的劇本很清楚:先用開放權重搶下社群——FLUX.2-dev 單月下載約 65 萬,上一代 dev 累計超過三千萬——再用 API 分層把商業收入做出來。Sacra 估計其年化營收在 2025 年 8 月已達約 $9,600 萬;同年 9 月,Meta 簽下一紙 $140M 的多年合約。
五層子線與架構:同一個骨幹切五刀
FLUX 家族的命名邏輯是「同一個骨幹,按速度與控制粒度切片」:
- klein(4B/9B):蒸餾到極致的即時檔。步數蒸餾+guidance 蒸餾雙開,GB200 上亞秒出圖,與上一代的 [schnell] 同為家族裡僅有的 Apache 2.0 權重。
- dev:32B 開放權重研究檔,guidance-distilled 自 pro 的同一條訓練軌。全精度要資料中心級 GPU(32B BF16 加 Mistral 文字編碼器),HF 與 BFL 合作提供了量化版讓 RTX 4090 可跑。
- flex:API 檔裡唯一暴露 steps 等低階參數的,給需要精細控制的排版/細節工作流。
- pro:量產主力,品質與價格的平衡點。
- max:頂規檔,grounding search 之外編輯一致性最強。
架構上值得記住三件事。第一,FLUX 不是傳統 U-Net 擴散,而是 rectified flow transformer——文字與影像 patch 在同一個 transformer 堆疊裡互相 attend,這讓「文字渲染準」從 FLUX.1 起就是招牌。第二,FLUX.2 把文字編碼器換成 Mistral 3 24B VLM,等於天生具備視覺語言理解,10 張參考圖的多引用編輯才做得動。第三,共享調變參數加上 guidance 蒸餾,讓負面提示詞在 FLUX 上技術上不可行——從 SD 遷移過來的人要先改掉這個習慣。
授權陷阱:開放是分層的,不是二元的
BFL 的雙軌策略比「開源 vs 閉源」複雜得多,實際是三層:
- Apache 2.0:FLUX.1 [schnell] 與 FLUX.2 [klein] 4B。可商用、可自架、可改作,無營收門檻。
- FLUX Non-Commercial License:FLUX.1 [dev]、Kontext [dev]、FLUX.2 [dev]、klein 9B。權重可下載,生成輸出也可以商用——被限制的是模型本身:拿它自架對外服務、或拿它訓練競品模型,都在禁止之列。想自架商用就得買 BFL 的授權方案(Builder 1 萬張/月起,往上按量議價)。這是最多人誤解的一層:坑不在「產出能不能賣」,在「部署算不算商用」。
- 純 API:pro/flex/max/Kontext pro/max 全閉源,只有 API 條款。
對比競爭格局:Midjourney、Ideogram、Google Imagen 從頭到尾無權重;Qwen-Image 主線掛 Apache 2.0 但新版已轉閉源。FLUX 是目前唯一「每一代都保證有一顆可自架的開放權重旗艦」的主流圖像家族——只是那顆旗艦多半是非商用授權。另外訓練資料構成至今未公開,版權風險得自己評估。
定價與競品對照
API 以 credit 計費(1 credit = $0.01),FLUX.2 按百萬像素計價,首 MP 之後遞減(官方定價):
| 模型 | 首張起價 | 備註 |
|---|---|---|
| FLUX.2 [klein] 4B | $0.014 | 每張,亞秒級 |
| FLUX.2 [klein] 9B | $0.015 | 每張 |
| FLUX.2 [pro] | $0.03(編輯 $0.045) | 後續 MP 半價 $0.015 |
| FLUX.2 [flex] | $0.05 | 可調 steps |
| FLUX.2 [max] | $0.07 | 含 grounding search |
| FLUX 3 Video | $0.17/s(hd)/ $0.29/s(fhd) | Draft 預覽 $0.06/s |
放到競品尺上:Google Imagen 4 Standard 約 $0.04/張、Ultra 約 $0.06;OpenAI GPT Image 約 $0.04/張;Midjourney 走 $30/月訂閱制不賣單張;Grok Imagine 圖像 $0.02 起。FLUX 的價格帶橫跨 $0.014–$0.07,等於一家公司同時覆蓋「最便宜可用」到「最高品質」兩端。
榜單位置要看快照。2025 年 12 月的 LMArena 文生圖快照裡,GPT Image 還領先 FLUX.2 [pro] 一個百分點以上;到 2026 年中的快照,兩者已接近同級(Artificial Analysis 圖像榜可看現值)。開放權重的 [dev] 入場 ELO 約 1,149(社群轉載的 2025-12 快照),是西方開放權重模型中最靠前的——同一份榜上排更高的是中國的 Hunyuan Image 3.0,同樣開放權重;編輯榜各快照則落在約 1,200–1,250 區間。
學到的事:Agent 開發者的選型建議
- 高吞吐/互動式生成(聊天內插圖、草稿迭代)→ klein 4B:$0.014、亞秒延遲、Apache 2.0 可自架兜底,量產成本敏感場景的首選。
- 正式產出/品牌素材 → pro:$0.03 的品質價格比目前沒有對手,4MP 大圖約 $0.075(首 MP 之後半價遞減)。
- 需要時事正確性(生成真實人物、近期產品)→ max 的 grounding search 是獨家能力,別家用不了。
- 本地/私有部署 → klein 4B(Apache)或 dev——dev 的輸出可商用,但拿它自架服務要買 Builder 授權,部署前先對照條款確認你的用途。
- 影片需求 → FLUX 3 Video 已 GA($0.17/s hd 起),但獨立 benchmark 尚未出爐,官方勝率數字先打折看。
- 混用策略:klein 打草稿 → pro 出成品 → max 只留給 grounding 必需的鏡頭,三檔價差五倍但 API 同一套。
整體來說,FLUX 的故事是「出走者用開放權重重建話語權」。Stability AI 留下的開源社群被原班人馬接走,BFL 再用分層授權把社群信任換成企業合約——Adobe、Canva、Meta 都在客戶名單上。2026 年的賭注更大:Self-Flow 把圖像、影片、音訊、機器人動作壓進同一組權重——「A model that only learns images can only generate images」,Rombach 受訪時說的這句話,是他們給整個行業下的戰帖。開放權重這條護城河守不守得住 FLUX 3 世代,是接下來一年最值得盯的事。
參考資料
- FLUX.2: Frontier Visual Intelligence — BFL 官方部落格 — 2025-11-25 發佈文,架構與各層定位
- black-forest-labs/flux2 — GitHub — 官方推論 repo,各 variant 授權對照表
- FLUX.2-dev — HuggingFace 模型卡 — 32B、非商用授權
- FLUX.2-klein-4B — HuggingFace 模型卡 — 4B、Apache 2.0、RTX 3090/4070 可跑
- BFL Docs — Pricing — 全模型 credit 定價、FLUX.2 百萬像素計價、FLUX 3 每秒計價
- BFL Docs — Release Notes — klein 發佈、FLUX 3 Video GA、MCP server 等時間戳
- Black Forest Labs raises $300M at $3.25B valuation — TechCrunch — Series B、創始團隊背景
- FLUX 3: Multimodal Video, Image & Audio — BFL 官方部落格 — 2026-07-23 Self-Flow 與 FLUX-mimic 公告
- FLUX 3 Video, Part 1 — BFL 官方部落格 — 2026-08-04 Video GA
- Black Forest Labs revenue, valuation & funding — Sacra — 營收估計與 Meta 合約
- Text-to-Image Leaderboard — Artificial Analysis — 圖像生成榜現值
- Grok's image generator, Black Forest Labs, is raising $100M at a $1B valuation — TechCrunch — Series A 傳聞口徑的原始報導
- AI 模型評測來源指南 — 本站
- AI 模型用途總覽 — 本站,系列導讀
Loading...