Skip to content
所有標籤

#llm-serving

2 篇文章
tech deep-dive 自架推論服務

TGI:HuggingFace 的 LLM 推論伺服器,以及它為什麼進入維護模式

Text Generation Inference(TGI)是 HuggingFace 自家的 LLM 推論伺服器,用 Rust + Python 實作,率先在開源推論引擎裡引入 continuous batching 與 Flash Attention。2026 年 3 月 GitHub 倉庫歸檔進入維護模式,官方建議遷移到 vLLM 或 SGLang。了解 TGI 仍然重要:它定義了後繼引擎的架構基線,而且許多 HuggingFace Inference Endpoint 上的既有服務仍在跑它。

tech deep-dive 自架推論服務

SGLang 自架推論服務:RadixAttention、OpenAI API 與多 GPU 部署

SGLang 是專攻生成式模型的推論引擎:用 RadixAttention 重用共同前綴的 KV cache,提供 OpenAI 相容 API、結構化輸出與多 GPU 平行化;它解決的是高吞吐 LLM serving,不是完整的產品後端。