Skip to content
所有標籤

#vision-language-model

15 篇文章
aiguideCMU 10-423 導讀

CMU 10-423 HW4:用 Q-Former 接起凍結的 GPT-2 與 DiT 做文生圖——題目結構、要改的檔案與算力

CMU 10-423 Spring 2026 的 HW4 總分 79:書面題考 LDM(7 分)、VQ-VAE(8 分)、CLIP(4 分)、以 PaliGemma2 為例的 VLM(18 分),程式題(40 分)要你在凍結的 GPT-2 與凍結的 CIFAR-10 DiT 之間只訓練一個 Q-Former,讓類別條件的擴散模型改吃文字。要寫的程式只有三個函式,14 個單元測試;官方估計 25 個 epoch 在 T4 上要 2–3 小時、A100 約 1 小時,資料與 DiT 權重得用 download_data.sh 從 Google Drive 下載。

aiguideCMU 10-423 導讀

CMU 10-423 L12–L13:文生圖、latent diffusion 與視覺語言模型

CMU 10-423 用兩堂課把生成模型接上兩種模態。L12 後半講文字怎麼控制圖片:GAN、自迴歸(Parti)、diffusion(DALL-E 2、Imagen)三條路線,最後落在 latent diffusion——先把圖片壓進自編碼器的潛在空間,再在那裡跑 DDPM,用 cross-attention 讀提示詞。L13 反過來,讓語言模型讀圖:用 CLIP/SigLIP 或 VQ-VAE 把圖片變成向量或整數,送進 decoder-only Transformer;只讀不畫的 VLM(PaliGemma、Qwen-VL)和能輸出圖片的 VLM(LWM、Gemini)差在影像是不是離散 token。

CS224R L17:用 RL 改進機器人基礎模型(VLA)

只用模仿學習訓練的 VLA,成功率常卡在 80% 左右,要讓機器人自己上工卻常需要 99% 以上。CS224R 第 17 講把「怎麼在真機上用 RL 改進 VLA」拆成三條路:把 RL 改寫成監督學習(iterated offline RL)、在 VLA 的表示或擴散雜訊上另外學一個小 policy、學一個小 policy 去修改 VLA 的動作。投影片自己說這是還沒解決的研究問題,內容是近期主題加講者觀點。

CS231N L16:視覺與語言——從 CLIP 的對比學習到會看圖說話的多模態基礎模型

CS231N Spring 2026 的視覺與語言講次,先把課程前半的「一個任務一個模型」換成「基礎模型」:先用大量多樣的資料預訓練一個模型,再用微調、zero-shot 或 few-shot 接到許多任務。主角有三條線。第一條是 CLIP:用 4 億組網路圖文配對做雙向對比學習,再把類別名稱寫成句子,就能不經微調直接分類;它也有弱點,分不出「草地上的杯子」和「杯子裡的草」。第二條是 LLaVA、Flamingo 到 Qwen3-VL、Molmo 的視覺語言模型:把圖片特徵接進 LLM,讓模型看圖輸出文字。第三條是 chaining:讓 LLM 寫描述或寫程式,把現成的視覺模型串起來。

CME295 第 9 講:Transformer 走出文字,LLM 不再從左寫到右

CME295 最後一講 128 頁投影片分三段:用八張圖複習前八講、Transformer 怎麼用在影像上(ViT 與兩種 VLM 接法)、以及一次吐出多個 token 的 masked diffusion LLM,最後談研究與應用的下一步。這堂不在考試範圍;2026 版把 diffusion LLM 拉成獨立一講,第 9 講改以多模態為主。

商業文件解析 API 橫評:專用 Parser、通用 VLM、三大雲,交叉點在哪?

商業文件解析分三條路線:專用 Parser(Cohere Parse $1.50/千頁、LlamaParse Agentic Plus 90.2%)、三大雲 Prebuilt(Azure/Google/AWS,結構化欄位抽取)、直接用通用 VLM(Fable 5.1 在 ParseBench 拿 78.92,圖表理解碾壓專用 parser,但每頁成本 3-16 倍且會幻覺)。10 萬頁/月純 OCR 各家都 ~$150,加表格後 AWS 跳到 $1,500、用 Claude Sonnet 5 跑要 $900。選型的第一個問題不是「哪家最準」,是「你要轉錄還是理解」。

Agentic Parsing:讓 Agent 決定怎麼解析文件

傳統文件解析用固定 pipeline 一體適用,但合約、財報、技術手冊各需不同策略。Agentic Parsing 讓 LLM agent 觀察文件後動態選工具——AgenticOCR 只解析需要的區域(視覺 token 省 70%+)、ParseBench 2,000 頁企業文件實測最佳方案也只拿 84.9%,沒有銀彈。

CS224N 第 17 講:Multimodality 的官方閱讀地圖

第 17 講由 Luke Zettlemoyer 客座談 multimodality,但官網沒有公開投影片或 agenda;官方閱讀清單可確認三條主線:視覺推理介面、early-fusion token 模型、文字自回歸加影像 diffusion。

Stanford CS224V 第 12 講:CHURRO 如何讓多語歷史文件變成可搜尋文字

CHURRO 以 HDML 表示整頁文字、版面與 metadata,整合跨世紀多語資料訓練 page-level VLM,再把輸出接到 HistoryGenie,讓檔案館材料能被檢索與對話。

CS336 Lecture 17:多模態模型先把影像變成 token,再處理語意與細節的衝突

第十七講把 CLIP/SigLIP、LLaVA、Qwen-VL 與 Chameleon 排成三條路:對比式 encoder 學語意、vision encoder+projector+LM 做理解、離散 image tokens 做生成;解析度、token budget 與 modality balance 是共同瓶頸。

aideep-dive

2026 上半年多模態模型盤點:原生融合 vs. 外接視覺,以及排行榜為什麼會互相打臉

純圖片理解已經打平:MMMU-Pro 上四家前沿模型全部過 80%,差距在 3 分內。真正分勝負的是影片、長文件 OCR、即時語音這幾條軸線,各有不同的領先者。但整理這些排名時最該學的一課,是兩份都算可信的來源對同一個 Video-MME 給出的榜首可以差超過 10 分,而且不是同一家。七月與八月又各換過一輪。

掃描 PDF 實測:10 種解析工具丟進考古題,結果差多少?

用 4 份台大碩班掃描考古題實測 10 種開源 PDF 解析工具。VLM 類(Firecrawl、MinerU 3.4、Marker v2)在公式和程式碼上全面碾壓傳統 OCR,但安裝踩坑才是真正的門檻——MinerU 舊包名會進依賴地獄、Marker 首次模型下載要 10 分鐘、PaddleOCR 缺引擎。實務推薦兩階段策略:RapidOCR 粗篩 + MinerU/Firecrawl 精查。

解析層:當結構要用模型推斷——而授權才是真正的選型軸

掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。

Midscene.js:押注純視覺的跨平台 UI 自動化框架

字節跳動開源(MIT)的 UI 自動化框架。UI 動作只靠截圖餵給視覺語言模型,不解析 DOM;一套 JS API 跨 Web / Android / iOS / 桌面。代價是每步較慢、token 較貴,而且高度綁在模型的 grounding 能力上。注意它已在 1.9.8 之後停掉 MCP,改走 Skills + CLI。

aideep-dive

DeepSeek-OCR:把長上下文壓成圖片的 10× 壓縮實驗

DeepSeek-OCR 的論文題目是 Contexts Optical Compression — OCR 只是手段,真正驗證的是『把文字渲染成圖片再餵給 VLM』能達到 10× 壓縮且 97% 精度。這對長上下文 LLM 與 RAG 的 token 成本是質變。