Skip to content
所有標籤

#speech-to-text

5 篇文章
tech deep-dive AI 模型家族

語音與音訊模型家族——Whisper 從開源改寫 ASR 到 ElevenLabs 收編語音 API,一條 ASR 一條 TTS 的四年演化

語音模型分兩條線:ASR 線由 Whisper 主導——2022/09 以 MIT 開源 1.55B 模型把轉錄成本打到趨近於零,v2→v3→turbo(decoder 32 層砍到 4 層)之後 OpenAI 轉閉源推 gpt-4o-transcribe;TTS 線則是 ElevenLabs 用品質與生態從新創做到 $11B 估值、$500M ARR,開源陣營靠 Kokoro(82M、Apache 2.0)與 Chatterbox 守住自架陣地。即時對話已被 speech-to-speech 的 Realtime API 重寫遊戲規則。

ai deep-dive

Deepgram Voice Agent API:從串流 STT、Turn Detection 到 TTS

Deepgram 把 streaming STT、LLM orchestration、turn detection、barge-in 與 streaming TTS 放進單一 WebSocket,也保留分開採用語音模型或 BYO LLM/TTS 的路徑。

ai deep-dive

ElevenLabs ElevenAgents:從即時語音到電話 Agent 的完整生命週期

ElevenLabs 已從 TTS 供應商擴成 ElevenAgents 平台:Scribe Realtime 收音、Flash 合成語音,再把 LLM、turn-taking、工具與電話整合收進同一條即時管線;選型關鍵是你要聲音品質,還是整個 agent 控制面。

ai deep-dive

LiveKit Voice Agents:從 WebRTC Room 到可插話的語音 Pipeline

LiveKit 把語音 agent 建模成 realtime media room 裡的 server participant,再由 AgentSession 串接 STT、turn detection、LLM、TTS 與 interruption。2026 年完成 1 億美元 C 輪、估值 10 億美元;它適合需要 WebRTC、多端 client、電話與可替換模型的產品,但自架 media server 不等於自架整條 AI pipeline。

ai deep-dive

Vapi:語音 Agent 的即時編排層,以及電話上線前的安全界線

Vapi 把電話與 Web 音訊、STT、LLM、TTS、tool calls 和 call observability 接成託管 voice runtime;可換 provider,卻不能搬走 Vapi 專屬的即時編排。官方 2026-05 自報已有 100 萬名開發者,並宣布 5,000 萬美元 B 輪。