Skip to content
所有標籤

#mamba

1 篇文章

CS336 Lecture 4:Attention 不只一種,MoE 也不是免費擴大模型

第四講沿著兩種稀疏化拆解現代 LLM:linear/recurrent attention 減少序列維度成本,MoE 讓每個 token 只啟用部分參數;兩者都把理論省下的 FLOPs 換成 routing、平衡與通訊問題。