跳至主要内容

AI 影音字幕工作流,打造 98% 精準度的影片字幕

· 閱讀時間約 8 分鐘

在製作影音內容時,處理字幕往往是最耗時的環節之一。傳統的語音轉文字(STT)工具雖然速度快,但經常會遇到口誤、冗字贅詞過多、斷句不自然以及排版混亂等問題,最後還是需要花費大量時間手動逐字校對。

今天就讓我來介紹一套高效的 AI 字幕工作流:透過 Google AI Studio 的 Gemini 2.5 Pro 進行智慧校正與排版,再結合剪映的「文稿匹配」功能自動對齊時間碼,讓你輕鬆輸出高品質的 SRT 字幕檔。

醬~

工作流核心概念​

這套工作流主要分為兩個階段:

  1. AI 智慧文本優化(Gemini 2.5 Pro): 利用大語言模型(LLM)強大的上下文理解能力,一次完成「錯別字校正、冗詞刪除、口誤修正、字數限制與中英文排版優化」。
  2. 自動時間碼對齊(剪映): 將優化後的純文字稿丟入剪映,利用「文稿匹配」功能自動與原始音訊對齊,生成帶有時間碼的字幕。

在這邊我選擇不用剪映直接請 AI 生成帶有時間戳記的檔案

步驟一:使用 Google AI Studio 進行語音稿校正與排版​

1. 操作步驟​

  1. 打開 Google AI Studio。
  2. 模型選擇 Google Gemini 2.5 Pro。
  3. 上傳錄音檔(如 .mp3 格式)。

錄音檔檔案叫小,不會把額度用光

  1. 輸入下方提示詞(Prompt)並執行。

2. 提示詞範本(Prompt)​

Plaintext

理解全文原意的基礎上,校正語音轉文字的錯誤,使用繁體中文輸出,我要做為影片字幕用,請符合以下輸出原則,不需要任何招呼說明,直接輸出成果:

1. 為了影片閱讀節奏,每一行不超過 18 個中文字,換行時每一行要做到完整句,自然不突兀,去除所有標點符號;當一行的字數過長超過 10 個字,但還不需要換行,你可以在語氣合理的地方加上半形空格,例如:"這是我的知識邊界 我的喜好"

2. 記住中文排版的原則:當中文字遇到英文和數字時,要加上一個半形空格,讓閱讀體驗更舒服,例如:我有 3 台 iPhone 手機;保留專業術語的英文正確寫法和縮寫,例如 FLAC, Notion, n8n, Claude Code

3. 你的目的是讓字幕更直觀好閱讀,可以刪除冗餘無意義的語氣詞,但保有講者的情緒;請記得保持原意不變,例如以下語氣詞可視情況刪除:「那」、「欸」、「哈哈哈」、「對吧」、「嘛」、「然後」

4. 當你判斷我是不是在講人,而在講 AI 或 LLM 時,不要用「他」或「她」,而是用「它」。

5. 字幕要有「引導」的目的,所以當真實語音講錯(或口誤),你需要判斷並把字幕寫精準正確,就能引導大家正確吸收,例如如果重複講一個詞,留第一個字幕,第二個就可以刪掉,例如當口語說「就是這個 這個 UPDF 的工具」,可以輸出為「就是 UPDF 這個工具」

※ 常見轉錄錯誤字辭典:
- "Cloud 公司" 是 "Claude 公司"
- "no 選" 是 "Notion"
- "cloud upper" 是 "Claude Opus"
- "聯盟週報" 是 "雷蒙週報"

步驟二:使用剪映「文稿匹配」生成 SRT 字幕​

取得 Gemini 2.5 Pro 輸出整理好的文字稿後:

  1. 開啟 剪映(CapCut),匯入原始音軌/影片檔。
  2. 點擊字幕功能中的 「文稿匹配」(Text to Subtitles / Match Text),將 Gemini 產出的文字貼入。
  3. 讓剪映自動將文字與音訊進行時間軸對齊。
  4. 進行一次快速播放複查(通常準確度可達 98% 以上)。
  5. 檢查無誤後,即可直接導出 .srt 字幕檔案! 這裡我是不推薦還要裝軟體啦~建議用達芬奇內建的功能就好了!

工作流 B:先確認整體內容摘要,條列錯誤給 AI 學習​

適合專有名詞較多的內容,先進行第一批校正

  1. 先確認整體內容摘要&快速條列錯字給 AI,讓 AI 挑出有疑問的地方,幫助他學習(1 mins)
請你先理解我上傳給你的音檔內容的原意、幫我做個列點式的逐字稿內容摘要,並把你認為有疑惑的地方特別告訴我,讓我先和你對齊,你是否能理解內容&專有名詞。我閱讀後會先給你校正建議,之後再讓你生成完整的逐字稿,我要做為字幕用。

記住中文排版的原則:當中文字遇到英文和數字時,要加上一個半形空格,讓閱讀體驗更舒服,例如:我有 3 台 iPhone 手機;保留專業術語的英文正確寫法和縮寫,例如 FLAC,JPEG,Notion, n8n
  1. 直接根據 AI 回覆,給予建議修正(5 mins)
  • 例如:
非常好!幾乎都很正確!

有幾個要校正:

1. 「Kemba 模式」是「Canva 模式」,沒有 s,這是 ChatGPT 的一個功能。

2. 「Cloud 公司」是「Claude 公司」。

3. 「城市碼」 是 「程式碼」

4. 如果出現 "紙尿褲" 通常是講 "資料庫"(AI 辨識語音時的常見錯誤)

最後請輸出完整逐字稿,你的目的是讓字幕更直觀好閱讀:為了影片閱讀節奏,每一行不超過 18 個中文字,換行時每一行要做到完整句,自然不突兀,去除所有標點符號;當一行的字數過長超過 10 個字,但還不需要換行,你可以在語氣合理的地方加上半形空格,例如:"這是我的知識邊界 我的喜好"刪除冗餘無意義的語氣詞,但保有講者的情緒;請記得保持原意不變,例如以下語氣詞可視情況刪除:「那」、「欸」、「哈哈哈」、「對吧」、「嘛」、「然後」

額外範例:​

請一律用繁體中文跟我對話。
這是一份我的教學影片字幕檔,請幫我先閱讀過整份理解上下文,再仔細檢查過每一行字幕,並直接修正錯字、刪除冗餘無意義的語氣詞,在不破壞原有的字幕時間結構的前提下。

請注意:
1. 你的目的是讓字幕更直觀好閱讀,並保持原意不變。
2. 專有名詞如 "ChatGPT"、"GPTs"、"Notion",需保留英文原字。
3. 當字幕過長時,不需要換行,只需要加上半形空格,如:"你可以更瞭解 到底是怎麼寫的"、"綠色的是 2025 年 因為這場加餐而新增的"
4. 記得中文的排版原則:當中文字遇到英文和數字時,要加上一個半形空格,讓閱讀體驗更舒服,例如:我有 3 台 iPhone 手機
5. 如果出現 "紙尿褲" 通常是講 "資料庫"(是 AI 辨識語音時的錯誤)
6. 當你判斷我是在講 AI 或 LLM 時,不要用「他」或「她」,而是要用「它」。

總結​

透過「Gemini 大模型理解校正 + 剪映時間軸自動匹配」這套組合拳,不僅省去了逐句打字和對時間軸的繁瑣過程,還能確保字幕符合專業的中文排版規範與影片觀看節奏。

我自己的提示詞:​

[角色與任務]
你是一位專業的繁體中文影音字幕校對與排版專家。請在完全理解全文原意的基礎上,將使用者提供的語音轉文字(STT)或原始字幕檔進行精準校正與格式化處理。

[處理原則與排版規範]

1. 格式輸出規範:
* 必須輸出帶有時間戳記的純文字 SRT 格式。
* 每一個時間號段內「僅能有一行文字」,絕對禁止在同一個時間戳記下換行出現兩行以上的文字。
* 完全去除所有標點符號(如逗號、句號、驚嘆號、問號等)。


2. 字數與空格排版:
* 每行文字絕對不能超過 18 個中文字。
* 當一行字數過長(超過 10 個字)但無須斷句時,請在語氣合理的停頓處加上「半形空格」(例如:"這是我的知識邊界 我的喜好")。
* 中英文及數字排版:中文字與英文字母、數字之間,必須加上一個「半形空格」(例如:"我有 3 台 iPhone 手機")。
* 專業術語規範:保留所有專有名詞與專業術語的正確英文大小寫及縮寫(如:FLAC, Notion, n8n, Claude Code, plugin, output)。


3. 語意精簡與錯字校正:
* 刪除冗餘無意義的口語贅詞(如:「那」、「欸」、「哈哈哈」、「對吧」、「嘛」、「然後」、「就是這個這個」),但須保留講者原有的情緒與語氣。
* 口誤與重複詞彙修正:當口語出現講錯、重複或結巴時,進行精準修飾,刪除重複詞(如將「就是這個 這個 UPDF 的工具」簡化修飾為「就是 UPDF 這個工具」)。
* 代名詞修正:當上下文指涉對象為 AI、LLM 或非人類軟體系統時,一律使用「它」,不可使用「他」或「她」。


4. 常見轉錄錯字替換對照(請嚴格執行替換):
* "Cloud 公司" -> "Claude 公司"
* "no 選" -> "Notion"
* "cloud upper" -> "Claude Opus"
* "聯盟週報" -> "雷蒙週報"



[執行要求]

* 請直接輸出最終校正後的 SRT 文字成果。
* 不要包含任何開場白、招呼語、解釋說明或結尾語。

---

以下為待校正語音轉文字檔:

[在此處貼上你的原始文字或 SRT]

其他推薦工具​