AI 用我的聲音幫我配音,每個月三百元

guantondabo
·
·
IPFS
·

以前我做短影音,最怕的不是想題材、不是剪輯,是錄音。

台灣的住家很難找到真正安靜的地方。冷氣要開,但冷氣聲會進麥克風;窗戶一開,隔壁的聲音跟著進來;孩子在隔壁房間,聲音也會飄過來。

不算環境噪音,還有自己的問題——說到某個字語氣卡住、咬字不清楚、這段講完發現前半句跑掉了——重錄。60 秒的影片,我試過花 40 分鐘才把配音搞定。搞定完心情也壞了,整支片的節奏感早就拖掉了。

後來我在這條內容產線做了一個改動,把配音這件事整個交給 AI——用我自己的聲音。

---

聲音克隆是怎麼回事

聲音克隆的原理很直白:你錄一批語音樣本,上傳給平台,平台訓練出你的聲音模型,之後你輸入文字,它就用你的聲音唸出來。

品質比幾年前強很多。正常的說明型口白——就是一般短影音的旁白語氣——現在已經相當自然,一般觀眾不容易聽出是 AI 配的。情緒複雜的段落、需要強烈語氣起伏的地方,細聽還是有人工感,但短影音節奏本來就快,對大多數題材影響不大。

---

我怎麼設定的

三個步驟,只有第一步需要你親自動手。

第一步:錄一次五分鐘的乾淨語音

找最安靜的時段,拿一支幾百元的小麥克風,把一段準備好的文稿唸一遍錄下來。不需要專業錄音室,環境安靜、沒有明顯雜音就夠了。

我選半夜、孩子睡著之後錄,總共大約花了 20 分鐘,包含前後準備。

這是整個過程唯一需要認真錄音的時機。錄完之後就不需要再麻煩了。

第二步:上傳訓練,等 10 到 20 分鐘

把語音檔上傳到聲音克隆平台,按開始訓練,等結果出來。全程不需要寫任何程式,平台介面就是上傳、按鈕、等待。

訓練完之後可以輸入幾句話試聽,確認聲音夠像、語調自然,就設定完成了。

第三步:之後每次打文字,AI 用你的聲音唸

文稿打好或系統自動生好之後,貼進去,按生成,大概 10 到 30 秒出一段配音音檔。

這個音檔直接拿去剪輯用。聲音是我的,但我沒有坐在那邊錄。

---

費用:三個層級

低——免費

大多數聲音克隆平台都有免費方案,但字符量有限制,一個月大概夠 6 到 8 分鐘的配音。只要一週一支短影音、每支不超過兩分鐘,免費方案勉強夠用。

缺點是部分免費方案不允許訓練自己的聲音模型,只能使用平台提供的預設音色,少了個人化。

中——月費 150 到 400 元台幣

這個範圍的方案可以建立自己的聲音模型,字符量夠一個月出 10 支以內的短影音。對大多數創作者來說這個層級已經足夠。

我目前用的是這個層級,月費大約台幣三百元出頭。

高——月費 1000 元以上

字符量大幅提升,適合每天都要產出內容、或同時維護多個帳號的規模。對大多數剛起步的創作者來說,暫時用不上。

---

有幾件事要特別小心

只克隆自己的聲音

這是最重要的一條。克隆別人的聲音——不管是名人、藝人還是你認識的人——沒有對方的書面授權,在法律上可能有問題,在道德上一定有問題。這條線不要踩。

看清楚你用的平台的條款

你訓練好的聲音模型,法律上歸誰、平台有沒有權利用於其他用途,每家平台的規定不一樣。在使用前確認一下:你的聲音資料怎麼儲存、出了問題能不能刪除。

AI 配音的內容,可能需要標示

部分影片平台開始要求 AI 生成的內容要做標示。我的做法是在發布文案加一行「配音由 AI 生成」,不解釋、不道歉,就當正常的工具說明。這個規則還在演變,方向是透明化。

情緒強的內容,AI 還是差一截

這個工具最適合說明型、資訊型的口白。需要很多感情起伏的段落,或者講述很個人的故事時,AI 的聲音有些空洞。這類內容我還是自己錄。

---

現在這條產線的樣子

我的流程從「靈感」到「配音生好」大概是:

手機輸入一句靈感 → 系統自動生稿 → AI 用我的聲音生配音 → 我審核一遍 → 剪進影片

配音這個環節,從 40 分鐘縮到 30 秒。省下的時間還給了剪輯、素材準備,和想下一個題材。

這不是「AI 取代了我說話」——是「AI 處理了我最不想做的那一段」,我去做 AI 做不來的:判斷題材夠不夠有趣、加進真實細節、決定哪個角度觀眾最有感。

---

想知道這條產線其他部分怎麼串起來的,追蹤帳號就看得到。或者到主頁填表單,有機會免費評估你工作裡有哪些事能這樣自動化。

CC BY-NC-ND 4.0 授权

喜欢我的作品吗?别忘了给予支持与赞赏,让我知道在创作的路上有你陪伴,一起延续这份热忱!