Skip to content
所有標籤

#multimodal

22 篇文章
aiguideCMU 10-423 導讀

CMU 10-423 L24–L26:語音、影片生成與互動式世界模型——生成模型怎麼從圖片走向聲音、時間和可操作的世界

CMU 10-423 最後三講把前面學過的 Transformer、tokenizer、latent diffusion 搬到新的資料型態。L24 講音訊:先把聲波轉成 mel-spectrogram 或離散 token,再用 Whisper 轉錄、用 AudioLM 與 MusicGen 生成、用 AudioLDM 做擴散。L25 講影片:3D UNet 加時空注意力、latent 影片擴散、DiT 與 Sora,最後到可互動的 Neural OS。L26 前半講世界模型:給定狀態與動作預測下一個狀態,分成先生成 3D 場景、互動式影片(Genie)、潛在表徵(V-JEPA、PAN)三條路線。

aiguideCMU 10-423 導讀

CMU 10-423 L14–L15:Cross-attention、DiT、Prompt-to-Prompt 與 Q-Former

文字條件是從哪裡注入圖片生成模型的?CMU 10-423 L14 的答案是 cross-attention:query 來自影像的潛在表示,key 和 value 來自提示詞,所以每個潛在像素都有一個「看向哪些字」的機率分布。這張注意力圖可以拿來做很多事:classifier-free guidance 讓生成更貼近提示,Prompt-to-Prompt 在不重新訓練的情況下,把舊的注意力圖抄進新提示詞的生成,只改圖片的一部分。DiT 則把 UNet 換成 Transformer,用 adaLN-Zero 注入條件。L15 前半的 Q-Former 用一小組可學習的 query,把凍結的影像編碼器接上凍結的 LLM,也就是 HW4 要你實作的東西。

aiguideCMU 10-423 導讀

CMU 10-423 HW4:用 Q-Former 接起凍結的 GPT-2 與 DiT 做文生圖——題目結構、要改的檔案與算力

CMU 10-423 Spring 2026 的 HW4 總分 79:書面題考 LDM(7 分)、VQ-VAE(8 分)、CLIP(4 分)、以 PaliGemma2 為例的 VLM(18 分),程式題(40 分)要你在凍結的 GPT-2 與凍結的 CIFAR-10 DiT 之間只訓練一個 Q-Former,讓類別條件的擴散模型改吃文字。要寫的程式只有三個函式,14 個單元測試;官方估計 25 個 epoch 在 T4 上要 2–3 小時、A100 約 1 小時,資料與 DiT 權重得用 download_data.sh 從 Google Drive 下載。

aiguideCMU 10-423 導讀

CMU 10-423 L12–L13:文生圖、latent diffusion 與視覺語言模型

CMU 10-423 用兩堂課把生成模型接上兩種模態。L12 後半講文字怎麼控制圖片:GAN、自迴歸(Parti)、diffusion(DALL-E 2、Imagen)三條路線,最後落在 latent diffusion——先把圖片壓進自編碼器的潛在空間,再在那裡跑 DDPM,用 cross-attention 讀提示詞。L13 反過來,讓語言模型讀圖:用 CLIP/SigLIP 或 VQ-VAE 把圖片變成向量或整數,送進 decoder-only Transformer;只讀不畫的 VLM(PaliGemma、Qwen-VL)和能輸出圖片的 VLM(LWM、Gemini)差在影像是不是離散 token。

CS231N L10:影片理解——多了時間維度,模型要怎麼改

CS231N 第 10 講把影片看成「2D+時間」的 T×3×H×W 張量,再沿著一條效率主線往下走:先在短片段上訓練、測試時平均多個片段;架構從逐幀 2D CNN、late fusion、3D CNN,到用光流分出動作的 two-stream 與把 2D 權重「充氣」成 3D 的 I3D;2021 年後換成 Transformer,但 token 數會爆炸,於是有 divided space-time attention、Video Swin、MViT 與 tubelet。最後一段擴展到時序定位、影音多模態、VideoLLM 與長影片理解,並用 HourVideo 指出這塊還差得遠。

CS231N L16:視覺與語言——從 CLIP 的對比學習到會看圖說話的多模態基礎模型

CS231N Spring 2026 的視覺與語言講次,先把課程前半的「一個任務一個模型」換成「基礎模型」:先用大量多樣的資料預訓練一個模型,再用微調、zero-shot 或 few-shot 接到許多任務。主角有三條線。第一條是 CLIP:用 4 億組網路圖文配對做雙向對比學習,再把類別名稱寫成句子,就能不經微調直接分類;它也有弱點,分不出「草地上的杯子」和「杯子裡的草」。第二條是 LLaVA、Flamingo 到 Qwen3-VL、Molmo 的視覺語言模型:把圖片特徵接進 LLM,讓模型看圖輸出文字。第三條是 chaining:讓 LLM 寫描述或寫程式,把現成的視覺模型串起來。

aiguideMIT 6.5940 導讀

MIT 6.5940 第 14 講:LLM 後訓練——從 SFT、RLHF 到只動 1% 參數的高效微調

第 14 講分三段。第一段是微調:SFT 用想要的回答做 next-token prediction,RLHF 先訓 reward model 再用帶 KL 懲罰的 RL 微調,DPO 把兩階段壓成一次監督式訓練;接著一路比較 PEFT:BitFit 只調 bias、Adapter 插小層但推論變慢、Prompt/Prefix-Tuning 佔用輸入長度,LoRA 用可併回權重的低秩分支解決推論延遲,QLoRA 再把主幹量化成 NF4,BitDelta 把微調差值壓到 1 bit。第二段是多模態 LLM:Flamingo 用 cross-attention、PaLM-E 與 VILA 把影像當 token、VILA-U 讓模型也能輸出影像。第三段是 prompt engineering:zero/few-shot、CoT 與 RAG。

台大李宏毅 ML 2026 導讀:HW10 Spoken Language Model——三種架構、Mimi 的 32 層 token,以及為什麼 Moshi 能邊聽邊說

HW10 是 12 題選擇題,只在 NTU COOL 作答。Section 1 比較語音語言模型的三種架構:Cascade(ASR → LLM → TTS,中間是文字)、End-to-End(直接在離散語音 token 上做 LM)、Thinker-Talker(LLM 負責想,另一個 decoder 負責說),Colab 讓兩個模型聽三段錄音判斷說話者性別,要你看出哪個是 cascade。Section 2 拆 Mimi:把情緒語料切成 32 層 RVQ token,取第 0、6、16、31 層畫 UMAP;再把語音、笑聲、音樂 encode 再 decode 聽看看壞在哪。剩下的題目讀 TWIST、AudioLM、LLaMA-Omni 2、Moshi、GLM-4-Voice,考 initialization、pretrain、interleaving 與 realtime/full-duplex。Colab 要先申請 Llama-3.2-3B-Instruct 授權並填 HF token。題目與 Colab 全公開,校外拿不到的是 COOL 評分與解答。

多模態與視覺:WebWatcher 重新定義 deep research

所有的 deep research agent 都是『文字為主』的——但真實世界不只有文字。WebWatcher(NeurIPS 2025)是第一個將視覺推理整合進 deep research 的系統,用 OCR、圖像搜尋、代碼執行等工具處理圖表、截圖、視訊等多元資訊。

小模型怎麼省參數:OpenELM 的 layer-wise scaling 與 MiniCPM 的三階段解凍

OpenELM 用 layer-wise scaling 把參數偏向靠近輸出的層,1.08B 參數、1.5T tokens 在 LLM360 平均分數上超越吃了 3T tokens 的 OLMo 1.2B(+2.36%);MiniCPM 用三階段解凍(先 Resampler、再視覺編碼器、最後全開)從零訓練多模態小模型,MiniCPM-V 4.5 以 8B 達到 VideoMME 30B 以下 SOTA,再靠 4-bit 量化把 fp16 的 16–17GB 記憶體壓到約 5GB。

Inkling——從 OpenAI 出走團隊到 975B 開源旗艦,以及 Tinker 微調平台的生態賭注

Thinking Machines Lab(Mira Murati 2025 年創立,20 億美元 seed、估值 120 億美元)2026 年 7 月以 Apache 2.0 釋出 Inkling(975B 總參數/41B 活躍、1M context、原生多模態、可控思考)與輕量版 Inkling-Small(276B/12B),搭配 Tinker 微調平台,把「可自訂」本身做成產品。

2024 AI 頂會在收什麼題目:Agent 元年與 Scaling 辯論

2024 年 AI 頂會的關鍵字是 agent、alignment、multimodal LLM 和 inference-time compute——LLM 相關論文在五大會議的佔比從 2023 年的顯著上升再度翻倍,agent 相關關鍵詞成長 4.3 倍,而 diffusion model 從「新興方向」正式晉升為與 LLM 並列的雙主軸。同時,傳統任務導向 NLP 研究持續萎縮,GAN 幾乎從頂會消失。

Gemini——Google 的原生多模態旗艦,1M context 與科學推理的雙料冠軍

Gemini 是 Google DeepMind 推出的原生多模態 LLM 家族,以 1M context window、原生影片/語音輸入和科學推理能力聞名。3.1 Pro 在 GPQA Diamond 94.1% 和 ARC-AGI-2 77.1% 拿下科學推理雙冠,定價 $2/$12 只有 Claude 的 1/6。3.8 Flash 以 $0.75/$3.75 提供追平 frontier 的 agentic coding 能力(Terminal-Bench 2.1 89.4%、DeepSWE v1.1 73.7%),且 3.6/3.7/3.8 連續三代不漲價。

Llama——從開源實驗到部署量最大的開源 LLM,以及 Meta 的閉源轉向

Llama 是 Meta 推出的開源 LLM 家族,以企業部署量最大、生態最成熟聞名。Llama 4 Scout(10M context)和 Maverick(17B active / 400B total MoE)是目前的開源多模態標竿,但 Meta 已在 2026 年 4 月轉向閉源 Muse Spark——Llama 4 很可能是最後一個主要的開源 Llama,且授權不是真正的開源(Llama 4 Community License,月活超 7 億需另外授權)。

Mistral——歐洲的開源 AI 挑戰者:用更小模型和歐洲主權打一場不一樣的仗

Mistral 是歐洲最成功的 AI 新創,以「更小、更快、更便宜」的策略和歐洲資料主權定位在 AI 市場殺出血路。Mistral Large 3 是歐洲最強的商用 LLM,Small 4 是 24B 級別的效率之王,Medium 3.5 則是專為 agentic coding 優化的 Modified MIT 開源模型。它的護城河不是技術規模,而是「歐洲合規」這張牌。

techguideAI 模型家族

AI 模型用途總覽——2026 年你該知道的模型地圖

2026 年 AI 模型按用途分成七大類、20+ 個子用途。這篇是「AI 模型家族」系列的導讀地圖——從用途找模型、從模型找家族,附每個用途的選型建議和最新排名。

Stanford CS224V 第 13 講:ReactGenie 如何讓語音命令與原生 GUI 共用同一個狀態

ReactGenie 以 React 元件加 annotations 暴露資料、動作與視圖,將複合語音命令解析成 DSL,並在同一份 UI context 中產生原生圖形輸出。

CS336 Lecture 17:多模態模型先把影像變成 token,再處理語意與細節的衝突

第十七講把 CLIP/SigLIP、LLaVA、Qwen-VL 與 Chameleon 排成三條路:對比式 encoder 學語意、vision encoder+projector+LM 做理解、離散 image tokens 做生成;解析度、token budget 與 modality balance 是共同瓶頸。

aideep-dive

Stanford CS25 V6:叫 Transformers United 的課,前兩場講的都不是 Transformer

CS25 是 Stanford 的 1 學分 seminar,唯一作業是出席,全程對外開放。2026 春季第六季九場講座裡,最值得看的三場是 Albert Gu 談 SSM 與 Transformer 的歸納偏誤、Charles Frye 談上千張 GPU 的推論服務、Victoria Lin 談原生多模態還沒解決什麼。

aideep-dive

2026 上半年多模態模型盤點:原生融合 vs. 外接視覺,以及排行榜為什麼會互相打臉

純圖片理解已經打平:MMMU-Pro 上四家前沿模型全部過 80%,差距在 3 分內。真正分勝負的是影片、長文件 OCR、即時語音這幾條軸線,各有不同的領先者。但整理這些排名時最該學的一課,是兩份都算可信的來源對同一個 Video-MME 給出的榜首可以差超過 10 分,而且不是同一家。七月與八月又各換過一輪。

aiguideAI 證照備考

NVIDIA NCA-GENM 備考路徑:多模態那張,但兩門必備課程只有 $500 講師版

NCA-GENM 與 NCA-GENL 同價同時長同級別,但重心完全不同:Experimentation 升到 25%(最重),Core ML 從 30% 降到 20%,並多出 Multimodal Data 15% 與 Performance Optimization 10% 兩塊。內容上考 U-Net、CLIP、擴散模型、多模態損失函數、attention map,以及 Riva/NeMo/Triton/ACE 這幾個 NVIDIA SDK。要注意成本結構:官方建議的五門課裡有兩門只有 $500 的講師版、沒有自學選項——純自學路線先天蓋不滿。官方規格:$125、1 小時、50–60 題、效期兩年、僅英文。

aiguideRAG 技法大全

Multimodal RAG:把圖片也納入知識庫

攀岩路線有大量圖片資訊(路線圖、岩壁照片),純文字 RAG 遺漏了這些。Multimodal RAG 讓圖片也能被搜尋和理解。