Skip to content
所有標籤

#ray-serve

3 篇文章
tech guide 自架推論服務

自架推論服務導讀:什麼時候值得自己跑模型

自架推論的關鍵不在引擎多快,而在你的 GPU 使用率:一張打滿的 A100 約 $0.70 / 百萬輸出 token,使用率掉到一成就變 $7,比多數雲端 API 貴。這篇是系列導讀,把七套工具分成三層,幫你判斷該選哪一層。

自架推論伺服器怎麼選:從 Ollama 到 Xinference,六套工具的定位與取捨

自架推論伺服器分三層:執行引擎(llama.cpp)、服務引擎(vLLM、SGLang)、模型管理平台(Ollama、Xinference、Triton)。選對層級比選對工具重要——先問你的瓶頸在排程還是在部署流程,再決定複雜度放在哪裡。

tech deep-dive 自架推論服務

Ray Serve 自架推論服務:Python 服務圖、GPU 排程與自動擴縮

Ray Serve 是建立在 Ray 上的分散式 serving layer:用 deployment 與 handle 組合 Python 服務圖,配置 CPU/GPU replica、自動擴縮與模型多工;它負責編排,不取代 vLLM 或 SGLang 的 LLM 執行引擎。