Skip to content
所有標籤

#kv-cache

2 篇文章
ai deep-dive Agent 生產線

context 與記憶:agent 失敗的真正位置

Chroma 測了 18 個前沿模型,全部隨輸入變長而跳崖式退化。記憶失效多半是檢索失效偽裝的。而 KV cache 的真正成本是頻寬不是儲存——decoding 每產生一個 token 都要讀過整個 cache。

ai guide

TurboQuant+ — 用兩階段量化把 KV Cache 壓到 2-bit,讓 MacBook 跑 100B 模型

TurboQuant+ 是 Google Research ICLR 2026 論文的開源實作,用 PolarQuant + QJL 兩階段量化壓縮 KV cache 達 3.8-6.4x,讓消費級硬體跑更大模型和更長上下文。