Skip to content
所有標籤

#openai-api

3 篇文章

Xinference:一個平台管 LLM、Embedding、語音與圖像模型的自架推論伺服器

Xinference 把 vLLM、SGLang、llama.cpp、Transformers、MLX 五種後端包在同一個管理層,用 Web UI 和 OpenAI 相容 API 統一管理 LLM、embedding、rerank、語音和圖像模型,適合需要多類型模型共存的自架部署;但管理層的解析邏輯也讓攻擊面比純 serving engine 大(CVE-2026-61539 是案例)。

ai deep-dive

Cerebras Inference:把 wafer-scale 速度放進 Agent 迴圈前,先看懂真正的瓶頸

Cerebras 的價值是把支援模型的生成階段大幅加速;但 Agent 的端到端速度仍取決於 prefill、工具 I/O、模型能力與平台相容性。

tech deep-dive 自架推論服務

SGLang 自架推論服務:RadixAttention、OpenAI API 與多 GPU 部署

SGLang 是專攻生成式模型的推論引擎:用 RadixAttention 重用共同前綴的 KV cache,提供 OpenAI 相容 API、結構化輸出與多 GPU 平行化;它解決的是高吞吐 LLM serving,不是完整的產品後端。