Skip to content
所有標籤

#vram

1 篇文章
ai deep-dive 認識 AI 模型

量化與推論最佳化:讓 70B 模型跑在你的筆電上

70B 模型原本需要 140GB VRAM,但量化到 4-bit 只需要 ~35GB,再用 llama.cpp 的部分卸載就能在消費級硬體上跑。GGUF 格式的命名規則(Q4_K_M、Q5_K_S)告訴你精度和大小的取捨。KV cache 是長對話變慢的主因。