ElevenLabs 是什麼?中文配音、Voice Cloning、商用與方案指南
ElevenLabs 提供文字轉語音、配音、聲音設計、聲音複製、音效與語音 Agent。選購時最重要的是模型語言、分鐘/credits 成本、商用授權,以及你是否真的有權複製該聲音。
ElevenLabs 涵蓋多語配音、Voice Cloning 與 API,功能範圍完整。免費版不能商用;Starter 才含商業授權與 Instant Voice Cloning,Professional Voice Cloning 則要 Creator 以上。
ElevenLabs 能幫你做什麼?
ElevenLabs 提供文字轉語音、聲音設計、自己的聲音複製、自動配音、語音 Agent 與 API。v3 主打 70 多種語言,但不同模型在語言、延遲、品質與 credit 消耗上仍有差異。
可調整聲音、語氣與模型,適合影片旁白、Podcast、電子學習及多語內容。
以文字描述建立角色聲音,或從超過一萬個社群聲音中尋找適合口音。
Instant Clone 適合快速建立,Professional Clone 需驗證本人聲音並使用更多訓練素材。
方案與成本怎麼看?
| 方案 | 官方標示 | 主要差異 | 適合情況 |
|---|---|---|---|
| Free | US$0;每月 10,000 credits,約 10 分鐘 TTS | TTS、STT、Music、Voice Design 等;非商用且發布需標示來源 | 測試中文發音與聲音風格 |
| Starter | US$6/月;30,000 credits,約 30 分鐘 TTS | 商業授權、Instant Voice Cloning、20 個 Studio 專案 | 小型商業影片與固定旁白 |
| Creator | US$22/月,首月官方顯示 US$11;121,000 credits | Professional Voice Cloning、可加購 credits | 規律內容製作與高擬真本人聲音 |
| Pro | US$99/月;600,000 credits | 較高輸出品質與 44.1kHz PCM API | 大量產製與產品整合 |
使用前最需要知道的限制
Professional Voice Cloning 官方目前只允許複製自己的聲音,並要求 Voice CAPTCHA 驗證。官方建議至少 30 分鐘乾淨錄音,最佳品質接近 2–3 小時;不要把公開影片中的他人聲音拿來訓練。
- 免費方案沒有商用授權;付費期間生成的內容才具備相應商用權。
- v3、Multilingual v2、Flash v2.5 的語言、速度與品質不同,不能只看『支援中文』。
- 中文可用不代表一定是自然台灣口音;應先用真實腳本測試人名、品牌與數字。
- 所有產品共用同一個 credits 池,使用 Music、Dubbing 或其他功能會減少可用 TTS 額度。
- 維持同一付費方案時,最多可把兩個月的未用 credits 帶到下一期;若降級或取消,未用 credits 不再保留。
繁中配音先別整篇生成:60 秒腳本檢查表
工作清單|尚未逐聲音實測「支援中文」不等於每個聲音都自然呈現台灣口音。先用同一段 60 秒測試稿檢查數字、英文品牌、人名與情緒,再決定是否生成整篇,能減少重做與 credits 浪費。
生成前先整理文字
- 數字、日期、幣別改寫成你希望它念出的形式。
- 英文品牌、縮寫、人名與地名分開試念。
- 用逗號、句號與短段落安排換氣;不要把一大段全貼上去。
- 移除 emoji、罕見符號與不必要的括號指示。
- 重要專有名詞建立發音字典或用讀音替代。
比較聲音時固定四件事
- 同一段測試稿。
- 同一個模型。
- 同一組速度與聲音設定。
- 同一輸出格式。
只更換 voice,才知道差異來自聲音本身,而不是設定變動。
ElevenLabs 官方建議避免直接使用數字與符號,並提供發音字典處理品牌、人名和縮寫;不同模型對停頓與發音標記的支援也不同。這裡是可重現的選聲流程,不是對所有繁中聲音的品質保證。查看官方 TTS 最佳做法 ↗
長篇配音別一次生成:把腳本做成可以局部返工的專案
製作流程|適合影片與課程真正會燒掉額度的不是第一次生成,而是改了一個品牌名、日期或語氣,卻被迫重做整段。多分鐘旁白應放進 Studio,按章節與段落管理;短廣告或試音再使用 Text to Speech 頁面。
先依任務選模型,不要只追最新
- Eleven v3:需要戲劇性、情緒或多人對話時再選,輸出變化也會更明顯。
- Multilingual v2:長篇旁白優先測試,官方定位是較穩定、適合長內容。
- Flash v2.5:大量草稿、即時播放或成本敏感的情境,速度與字元成本更有利。
官方建議的影響順序是:Voice 選擇 > Model > Settings。聲音本身不合適時,調半天滑桿也很難救回來。
把腳本拆成可重做的小單位
- 每段控制在一到三句,依畫面切點與換氣分段。
- 先把日期、金額、百分比和縮寫改寫成實際念法。
- 品牌名、人名和專有名詞先做發音字典或替代拼法。
- 鎖定 voice、model、speed 與主要設定,再開始全篇生成。
- 只重生有問題的段落,不要因一個錯字重做整章。
設定從保守基準開始
- 先以 Stability 約 50、Similarity 約 75、Style 0 作為官方常見起點。
- 語速先維持 1.0;中文資訊密集時再小幅放慢。
- 不要一次大幅調整多個滑桿;每輪只改一項並保留版本。
- 相同設定仍可能得到不同表演,驗收要靠實際試聽,不是只看數值。
輸出前四項驗收
- 內容:數字、專有名詞、網址和人名全部正確。
- 聲音:前後段落音色、速度和音量沒有突然改變。
- 剪輯:句尾沒有被截斷,停頓能對上畫面。
- 交付:長專案保留章節檔與完整檔,必要時開啟音量正規化。
ElevenCreative Studio 可將多章節專案輸出為單一檔案,或輸出各章節 ZIP,也能啟用音量正規化。若沒有修改文字或 voice,官方目前允許所選段落免費重新生成兩次。聲音複製另有權利限制:Instant Voice Clone 必須擁有聲音或獲得授權;Professional Voice Clone 需要本人聲音驗證,不能替其他人建立。資料核實:2026 年 7 月 21 日。TTS 選擇與設定 ↗ Studio 輸出 ↗ 聲音複製 ↗
智藏所的選購建議
先用免費版測一段 60–90 秒真實腳本;若要放在營利影片,Starter 是最低合理門檻。只有確定需要高擬真本人聲音,才升 Creator 做 Professional Voice Cloning。
看完還是不懂?
告訴我們你使用的工具、想完成的事和卡住的位置。問題會先經人工審核,不會送出後立即公開。