Skip to content
所有標籤

#voice-cloning

2 篇文章
tech deep-dive AI 模型家族

語音與音訊模型家族——Whisper 從開源改寫 ASR 到 ElevenLabs 收編語音 API,一條 ASR 一條 TTS 的四年演化

語音模型分兩條線:ASR 線由 Whisper 主導——2022/09 以 MIT 開源 1.55B 模型把轉錄成本打到趨近於零,v2→v3→turbo(decoder 32 層砍到 4 層)之後 OpenAI 轉閉源推 gpt-4o-transcribe;TTS 線則是 ElevenLabs 用品質與生態從新創做到 $11B 估值、$500M ARR,開源陣營靠 Kokoro(82M、Apache 2.0)與 Chatterbox 守住自架陣地。即時對話已被 speech-to-speech 的 Realtime API 重寫遊戲規則。

ai deep-dive

Cartesia 深入介紹:從 Sonic 串流 TTS 到即時語音 Agent Pipeline

Cartesia 的核心是 Sonic 即時 TTS、Ink STT 與串流推論;雖然 2026 年已有 Line voice-agent 平台,選型時仍要分清模型層與電話 orchestration,並把 voice cloning 同意、資料保存與 fallback 自己設計好。