Skip to content
所有標籤

#text-to-speech

6 篇文章
tech deep-dive AI 模型家族

語音與音訊模型家族——Whisper 從開源改寫 ASR 到 ElevenLabs 收編語音 API,一條 ASR 一條 TTS 的四年演化

語音模型分兩條線:ASR 線由 Whisper 主導——2022/09 以 MIT 開源 1.55B 模型把轉錄成本打到趨近於零,v2→v3→turbo(decoder 32 層砍到 4 層)之後 OpenAI 轉閉源推 gpt-4o-transcribe;TTS 線則是 ElevenLabs 用品質與生態從新創做到 $11B 估值、$500M ARR,開源陣營靠 Kokoro(82M、Apache 2.0)與 Chatterbox 守住自架陣地。即時對話已被 speech-to-speech 的 Realtime API 重寫遊戲規則。

ai deep-dive

Cartesia 深入介紹:從 Sonic 串流 TTS 到即時語音 Agent Pipeline

Cartesia 的核心是 Sonic 即時 TTS、Ink STT 與串流推論;雖然 2026 年已有 Line voice-agent 平台,選型時仍要分清模型層與電話 orchestration,並把 voice cloning 同意、資料保存與 fallback 自己設計好。

CS124 Week 8 Speech and PA7/Git Lab:把 TTS→STT pipeline 當成可稽核的資訊損失

Week 8 以 PA6b 把文字轉語音再轉回文字,要求分類錯誤、檢查格式遺失與口音偏差;同週 Lab 4 以 Git 與 PA7 協作把課程帶入團隊 agent 專案。

ai deep-dive

Deepgram Voice Agent API:從串流 STT、Turn Detection 到 TTS

Deepgram 把 streaming STT、LLM orchestration、turn detection、barge-in 與 streaming TTS 放進單一 WebSocket,也保留分開採用語音模型或 BYO LLM/TTS 的路徑。

ai deep-dive

ElevenLabs ElevenAgents:從即時語音到電話 Agent 的完整生命週期

ElevenLabs 已從 TTS 供應商擴成 ElevenAgents 平台:Scribe Realtime 收音、Flash 合成語音,再把 LLM、turn-taking、工具與電話整合收進同一條即時管線;選型關鍵是你要聲音品質,還是整個 agent 控制面。

ai deep-dive

Vapi:語音 Agent 的即時編排層,以及電話上線前的安全界線

Vapi 把電話與 Web 音訊、STT、LLM、TTS、tool calls 和 call observability 接成託管 voice runtime;可換 provider,卻不能搬走 Vapi 專屬的即時編排。官方 2026-05 自報已有 100 萬名開發者,並宣布 5,000 萬美元 B 輪。