whatsub 回首頁
WHAT'SUB VS GOOGLE SPEECH-TO-TEXT

Google 語音轉文字可以拿來做字幕嗎?
跟 What'Sub 差在哪

這頁由 What'Sub 團隊撰寫,立場先講明。Google Cloud Speech-to-Text 強的地方照寫——你可以自己判斷。

先給答案:Google Cloud Speech-to-Text 是雲端辨識 API,What'Sub 是影片字幕的工作流,兩者負責的段落不一樣。你要把辨識接進自己的系統、要即時串流、要一次處理很多種語言,那邊是對的地方;要的是能直接上到影片上的字幕,中間還有幾步路。

這頁不比誰聽得比較準,講的是拿到辨識結果之後還要做什麼

先分清楚三個「Google 語音轉文字」

同一個名字底下其實是三種東西,先對號入座再往下看:

Google Cloud Speech-to-Text 好用的地方

它支援一百多種語言與地區腔調,有免費額度可以先試,能做即時串流辨識、說話者分離、自動標點,還能給它一份詞彙清單去加強專有名詞。要把語音轉文字接進自己的產品或流程,尤其其他服務本來就在 Google Cloud 上,那是它的主場。

對「我只要文字、而且我自己寫程式」的需求——客服錄音分析、會議記錄系統、內容檢索——這樣就夠了,沒有必要再多一層工具。

訊號一:它交給你的是 JSON,不是字幕檔

辨識完回來的是一份結構化結果:文字、信心值、每個字詞的時間碼。它不會給你一份可以直接用的 SRT——那要自己寫程式組。

而且在辨識之前還有一段工:超過大約一分鐘的音檔不能同步呼叫,要先把檔案搬進 Google Cloud Storage,再用非同步的方式辨識、完成後取回。一支十分鐘的影片,光是「把檔案送進去、把結果拿出來」就是一段流程。

訊號二:逐字稿到字幕之間,還有幾步

文字加時間碼不等於字幕。要能上到影片上,中間至少還有這些:照人說話的節奏斷句(不是照標點或固定字數)、每句長度要讓觀眾讀得完、時間要對得上嘴、字幕要有你的視覺、最後要能進剪輯軟體或燒進畫面。

這幾步用手做,一支十分鐘的影片通常比辨識本身還久——而且每支都要重來一次。What'Sub 做的就是這一段。

訊號三:字幕的樣子與去處

字型、大小、顏色、描邊、位置、直式橫式,這些是字幕能不能用的關鍵,也是頻道視覺的一部分。做完之後還要有去處:SRT/VTT 上平台、FCPXML 帶樣式進 Final Cut、去背的字幕影片疊進剪輯專案、或直接燒成成品影片。

What'Sub 的樣式在網頁上調好、存起來下一支直接套,匯出時就是你看到的樣子。

訊號四:校對的介面決定總時間

任何辨識都會有錯字——同音字、專有名詞、講話重疊。真正決定你花多久的,不是錯了幾個字,是改起來順不順

What'Sub 的編輯器是純句子清單:上下鍵走句子、快捷鍵拆句併句、改完字時間自己對回聲音、每句旁邊標著秒數與每秒字數,讓你一眼看出哪句觀眾讀不完。這些是為了把校對那一段壓短而做的。

一張表看完

What'SubGoogle Cloud Speech-to-Text
它是什麼影片字幕工作流(聽打→斷句→樣式→匯出)雲端語音辨識 API
開始用之前瀏覽器打開就能用要建 Google Cloud 專案並開通計費
主要產物能直接用的字幕辨識結果 JSON(含字詞時間碼)
字幕檔輸出SRT/VTT/逐字稿/FCPXML要自己把結果組成字幕檔
長音檔影片直接丟進去逾約一分鐘要先上傳 Cloud Storage 再非同步辨識
語意斷句按說話節奏切,可再拆併以逐字結果為主
閱讀速度提示每句標秒數/字數/每秒字數
字幕樣式網頁上調,存得起來重複套
帶進 Final CutFCPXML,樣式一起帶
燒進影片瀏覽器內直接燒,另有去背字幕影片
即時串流辨識沒有
API沒有完整的 API 與 SDK
語言80 多種可選,繁體中文是特化的那一種(語意斷句、簡繁下沉、台灣用語)一百多種語言與地區腔調
「—」代表該功能不在對方的產品範圍內,不是做得比較差。功能現況查於 2026 年 8 月,以各官網為準。

其實可以一起用

如果你手上已經有一份逐字稿或 SRT,可以直接拖進 What'Sub 的工作區當「修正字幕」——系統會告訴你它跟目前字幕差了幾句,也能把你改過的用詞收進自己的詞庫。接著就是斷句、樣式、匯出那一段。

常見問題

Google Cloud Speech-to-Text 可以直接輸出 SRT 字幕檔嗎?+
不行。它回傳的是一份辨識結果(JSON),裡面有文字與字詞的時間碼,要自己寫程式把它組成 SRT 或 VTT。組完之後,斷句、時間微調、字幕樣式與匯出格式還是要另外處理。
它跟 YouTube 自動字幕、Google 文件的語音輸入是同一個嗎?+
不是同一個東西。Google Cloud Speech-to-Text 是雲端辨識 API,要有 Google Cloud 專案才能呼叫;YouTube 自動字幕是影片平台的內建功能;Google 文件的語音輸入是即時聽寫。三者的結果與去處都不一樣。
Google 語音轉文字要收費嗎?有免費額度嗎?+
有免費額度可以先試,超過之後按音檔長度計費,並且要先在 Google Cloud 開通計費帳戶。實際級距與價格以官網為準——雲端服務的價目表調整得比我們寫得快。
Google 語音轉文字支援繁體中文嗎?+
中文在支援清單裡,而且是用地區代碼分開的(台灣華語、香港粵語、大陸普通話各自一組),呼叫時要自己選對。實際感受建議拿自己的素材試一段,每個人的內容類型差很多。
一定要會寫程式才能用嗎?+
基本上是。它的定位是給開發者串進系統的 API:要建 Google Cloud 專案、開計費、拿金鑰,再用 SDK 或 REST 呼叫。Cloud Console 裡雖然有可以試打的介面,但那是用來驗證設定,不是拿來處理一支一支影片的工作環境。
長一點的影片可以直接丟進去嗎?+
超過大約一分鐘的音檔不能用同步辨識,要先把檔案放進 Google Cloud Storage,再用非同步(長時間執行)的方式辨識,完成後取回結果。也就是說在辨識之前,還多了一段自己搬檔案的工。
逐字稿跟字幕到底差在哪?+
逐字稿是「他說了什麼」,字幕是「觀眾在畫面上讀什麼」。差別在斷句要照說話節奏、每句要讀得完、時間要對得上嘴、還要有視覺樣式與匯出格式。同一份文字,這幾步做不做決定它能不能上片。
Google 語音轉文字可以調字幕的字型跟顏色嗎?+
那不在它的產品範圍內——它做的是把聲音變成文字。字幕的視覺要在字幕工具或剪輯軟體裡處理。
Google 語音轉文字可以把字幕燒進影片嗎?+
燒錄不是它負責的段落。What'Sub 可以在瀏覽器內直接燒成 MP4,也能輸出去背的字幕影片疊進剪輯專案。
可以把別的工具做好的 SRT 匯進 What'Sub 嗎?+
可以,把 .srt 拖進工作區就行(頂欄也有「匯入修正字幕」)。系統會顯示它跟目前字幕差了幾句,可以整份覆蓋;偵測到的換詞還能勾選加進你的詞庫。
什麼情況該用 Google Cloud Speech-to-Text?+
你要自己開發應用:把辨識接進自己的系統、需要即時串流辨識、要處理很多種語言、或者其他服務本來就架在 Google Cloud 上,接起來最省事。
什麼情況該用 What'Sub?+
要的是能直接上片的繁體中文字幕:語意斷句、快速校對、字幕樣式、FCPXML 進 Final Cut、去背字幕影片、直接燒錄。
What'Sub 的影片會上傳嗎?+
影片本身留在你的電腦不上傳,只有抽出來的聲音會送去辨識。未公開的影片、客戶的案子,這一點通常是選工具的關鍵。
What'Sub 支援台語嗎?+
沒有為台語特別調校過。台灣國語、中英夾雜的日常說話是主力場景;粵語有做過保護處理。要做台語內容建議先用自己的素材試一段再決定。
What'Sub 要安裝軟體嗎?+
不用,瀏覽器打開就能用,Windows 和 Mac 都可以。編輯字幕需要電腦,手機和平板可以登入與管理帳號。
辨識大概多準?+
沒有工具能保證百分之百,同音字、專有名詞、講話重疊都會出錯,所以我們把重點放在「修起來快」:句子編輯器、快捷鍵、每句的閱讀速度提示,都是為了讓校對這一段變短。
What'Sub 是誰做的?+
出自 YouTube 頻道《壹加壹》,我們自己剪片、自己上字幕,做字幕的痛點就是這個工具的來歷。同一組人也設計了「粗線體」與「粒線體」兩套中文字型。
認識 What'Sub

其他比較:剪映 CapCut Whisper YouTube 自動字幕 DaVinci Resolve 其他工具比較