Google 語音轉文字可以拿來做字幕嗎?
跟 What'Sub 差在哪
這頁由 What'Sub 團隊撰寫,立場先講明。Google Cloud Speech-to-Text 強的地方照寫——你可以自己判斷。
先給答案:Google Cloud Speech-to-Text 是雲端辨識 API,What'Sub 是影片字幕的工作流,兩者負責的段落不一樣。你要把辨識接進自己的系統、要即時串流、要一次處理很多種語言,那邊是對的地方;要的是能直接上到影片上的字幕,中間還有幾步路。
這頁不比誰聽得比較準,講的是拿到辨識結果之後還要做什麼。
先分清楚三個「Google 語音轉文字」
同一個名字底下其實是三種東西,先對號入座再往下看:
- Google Cloud Speech-to-Text:這頁講的這個。雲端辨識 API,要有 Google Cloud 專案才能呼叫,給開發者用。
- YouTube 自動字幕:影片平台的內建功能,另有一頁專講。
- Google 文件的語音輸入:一邊說一邊打字,做的是文件不是字幕。
Google Cloud Speech-to-Text 好用的地方
它支援一百多種語言與地區腔調,有免費額度可以先試,能做即時串流辨識、說話者分離、自動標點,還能給它一份詞彙清單去加強專有名詞。要把語音轉文字接進自己的產品或流程,尤其其他服務本來就在 Google Cloud 上,那是它的主場。
對「我只要文字、而且我自己寫程式」的需求——客服錄音分析、會議記錄系統、內容檢索——這樣就夠了,沒有必要再多一層工具。
訊號一:它交給你的是 JSON,不是字幕檔
辨識完回來的是一份結構化結果:文字、信心值、每個字詞的時間碼。它不會給你一份可以直接用的 SRT——那要自己寫程式組。
而且在辨識之前還有一段工:超過大約一分鐘的音檔不能同步呼叫,要先把檔案搬進 Google Cloud Storage,再用非同步的方式辨識、完成後取回。一支十分鐘的影片,光是「把檔案送進去、把結果拿出來」就是一段流程。
訊號二:逐字稿到字幕之間,還有幾步
文字加時間碼不等於字幕。要能上到影片上,中間至少還有這些:照人說話的節奏斷句(不是照標點或固定字數)、每句長度要讓觀眾讀得完、時間要對得上嘴、字幕要有你的視覺、最後要能進剪輯軟體或燒進畫面。
這幾步用手做,一支十分鐘的影片通常比辨識本身還久——而且每支都要重來一次。What'Sub 做的就是這一段。
訊號三:字幕的樣子與去處
字型、大小、顏色、描邊、位置、直式橫式,這些是字幕能不能用的關鍵,也是頻道視覺的一部分。做完之後還要有去處:SRT/VTT 上平台、FCPXML 帶樣式進 Final Cut、去背的字幕影片疊進剪輯專案、或直接燒成成品影片。
What'Sub 的樣式在網頁上調好、存起來下一支直接套,匯出時就是你看到的樣子。
訊號四:校對的介面決定總時間
任何辨識都會有錯字——同音字、專有名詞、講話重疊。真正決定你花多久的,不是錯了幾個字,是改起來順不順。
What'Sub 的編輯器是純句子清單:上下鍵走句子、快捷鍵拆句併句、改完字時間自己對回聲音、每句旁邊標著秒數與每秒字數,讓你一眼看出哪句觀眾讀不完。這些是為了把校對那一段壓短而做的。
一張表看完
| What'Sub | Google Cloud Speech-to-Text | |
|---|---|---|
| 它是什麼 | 影片字幕工作流(聽打→斷句→樣式→匯出) | 雲端語音辨識 API |
| 開始用之前 | 瀏覽器打開就能用 | 要建 Google Cloud 專案並開通計費 |
| 主要產物 | 能直接用的字幕 | 辨識結果 JSON(含字詞時間碼) |
| 字幕檔輸出 | SRT/VTT/逐字稿/FCPXML | 要自己把結果組成字幕檔 |
| 長音檔 | 影片直接丟進去 | 逾約一分鐘要先上傳 Cloud Storage 再非同步辨識 |
| 語意斷句 | 按說話節奏切,可再拆併 | 以逐字結果為主 |
| 閱讀速度提示 | 每句標秒數/字數/每秒字數 | — |
| 字幕樣式 | 網頁上調,存得起來重複套 | — |
| 帶進 Final Cut | FCPXML,樣式一起帶 | — |
| 燒進影片 | 瀏覽器內直接燒,另有去背字幕影片 | — |
| 即時串流辨識 | 沒有 | 有 |
| API | 沒有 | 完整的 API 與 SDK |
| 語言 | 80 多種可選,繁體中文是特化的那一種(語意斷句、簡繁下沉、台灣用語) | 一百多種語言與地區腔調 |
其實可以一起用
如果你手上已經有一份逐字稿或 SRT,可以直接拖進 What'Sub 的工作區當「修正字幕」——系統會告訴你它跟目前字幕差了幾句,也能把你改過的用詞收進自己的詞庫。接著就是斷句、樣式、匯出那一段。