GPUtw.ai 是什麼:台灣在地 GPU 雲端、短租算力與研究者工作流
GPUtw.ai 是台灣在地的短租 GPU 雲端,核心不是最大規模的算力,而是台灣機房、預付點數、Jupyter/ComfyUI/Ollama/vLLM 範本、Vault 與團隊帳務。公開資料足夠做服務介紹,還不足以當正式採購或 production 背書。
GPUtw.ai 是台灣在地的短租 GPU 雲端,核心不是最大規模的算力,而是台灣機房、預付點數、Jupyter/ComfyUI/Ollama/vLLM 範本、Vault 與團隊帳務。公開資料足夠做服務介紹,還不足以當正式採購或 production 背書。
2026 年開源模型在 coding benchmark 追平閉源,但自架不只是選模型——vLLM 適合高併發生產服務、SGLang 在前綴重用場景快 29%、Ollama 是本地開發首選、llama.cpp 吃最少資源。A100 雲端租金約 $1.4-2.2/hr,自架損益兩平點大約在每月 100M tokens。
自架推論伺服器分三層:執行引擎(llama.cpp)、服務引擎(vLLM、SGLang)、模型管理平台(Ollama、Xinference、Triton)。選對層級比選對工具重要——先問你的瓶頸在排程還是在部署流程,再決定複雜度放在哪裡。
Xinference 把 vLLM、SGLang、llama.cpp、Transformers、MLX 五種後端包在同一個管理層,用 Web UI 和 OpenAI 相容 API 統一管理 LLM、embedding、rerank、語音和圖像模型,適合需要多類型模型共存的自架部署;但管理層的解析邏輯也讓攻擊面比純 serving engine 大(CVE-2026-61539 是案例)。
Appwrite 把 Auth、TablesDB、Storage、Functions、Realtime 與 Messaging 放進一致 API;Cloud 與 self-hosted 功能相近,維運責任卻完全不同。
CapRover 用 Docker Swarm、Nginx 與 captain-definition 提供簡化 PaaS;stateless app 可擴展,local persistent app 則被鎖在單一節點。
Coolify 用 SSH 控制自有 server 上的 Docker、proxy 與 resources;它簡化部署,但 OS、安全、容量、資料備份與平台復原仍由團隊負責。
Dokku 用 Git receiver、buildpack/Dockerfile、process model、Nginx 與 plugins 在單機提供 Heroku 式體驗;簡潔來自刻意縮小編排範圍。
Dokploy 同時支援單 container Application 與 Compose/Stack,並把單機、獨立 remote servers、Swarm cluster 定義成三種不同部署拓撲。
Hetzner Cloud 以 Server、Network、Volume、Load Balancer 與 Firewall 提供精簡 IaaS;價格優勢只有在 patch、HA、backup、egress 與 on-call 成本算進去後才成立。
Kamal 從操作者端透過 SSH 把 immutable image 部署到 servers,靠 kamal-proxy 切換流量;它不是 scheduler,也不替團隊管理主機與資料。
PocketBase 把 SQLite、collections、Auth、file storage、SSE realtime 與 admin UI 包進小型執行檔;部署簡單,但單機邊界與 v1 前相容性風險必須明講。
Proxmox VE 整合 VM、container、cluster、HA、storage 與 backup;它降低虛擬化管理門檻,但 hardware、quorum、network、capacity 與 DR 仍由你負責。
vLLM 是自架 LLM 推論的事實標準(GitHub 89,470 stars,2026-08-21 實查),核心是把 KV cache 當作業系統的分頁來管。但選型的關鍵不在它多快,在你的 GPU 使用率:以 Red Hat 實測的每秒 793 個輸出 token 換算,一張打滿的 A100 約 $0.70 / 百萬輸出 token,使用率掉到一成就變 $7——比多數雲端 API 貴。