Skip to content
所有標籤

#qwen-vl

1 篇文章

CS336 Lecture 17:多模態模型先把影像變成 token,再處理語意與細節的衝突

第十七講把 CLIP/SigLIP、LLaVA、Qwen-VL 與 Chameleon 排成三條路:對比式 encoder 學語意、vision encoder+projector+LM 做理解、離散 image tokens 做生成;解析度、token budget 與 modality balance 是共同瓶頸。