所有標籤 Claude Code 成本隨 context 大小累積:企業部署平均每位開發者每個活躍日約 $13、每月 $150–250。本文整理 /usage 與 /insights 追蹤、六種省 token 手段,以及「該用哪個模型」的系統性答案:provider-dependent model aliases、effort levels、fast mode(Opus 5/4.8 每 MTok $10/$50)與 advisor 工具。
Claude Code 的 prompt caching 靠 prefix 完全匹配運作:命中時重讀計費約為標準 input 的 10%,但換模型、改 effort、開 fast mode、連斷 MCP server、整工具 deny 都會讓下一輪整段重算。TTL 預設五分鐘,訂閱方案的主對話與少數 helper requests 用一小時。
Modal 是按秒計費的 serverless GPU 平台,同時把 agent sandbox 做成一級公民(官方自報累計啟動逾 10 億個 sandbox、佔營收三分之一以上)。選型的關鍵不是它多方便,是你的 GPU 使用率:2026-08-21 實查,Modal A100 80GB 折算 $2.50/hr、RunPod 同卡 $1.59/hr,使用率超過六成四自己開機器就比較便宜;但同一天 H100 SXM Modal $3.95/hr、Lambda $3.99/hr,這張卡的溢價幾乎是零。
vLLM 是自架 LLM 推論的事實標準(GitHub 89,470 stars,2026-08-21 實查),核心是把 KV cache 當作業系統的分頁來管。但選型的關鍵不在它多快,在你的 GPU 使用率:以 Red Hat 實測的每秒 793 個輸出 token 換算,一張打滿的 A100 約 $0.70 / 百萬輸出 token,使用率掉到一成就變 $7——比多數雲端 API 貴。