用 Whisper 做字幕會遇到什麼?
跟 what'sub 差在哪
先給答案:Whisper 免費、開源、音檔完全不出你的電腦,這三件事沒有雲端工具贏得了,包括我們。如果你要的是逐字稿或帶時間碼的 SRT/VTT,而且願意花時間安裝、挑模型、等它跑,官方工具就能完成,不必為字幕檔另付費。
會需要搭配其他工具的情況是:你還想集中校對、調整斷句、設計字幕樣式,或直接輸出帶字幕的影片。下面講的是拿到字幕檔之後的流程。
Whisper 真正好用的地方
它是 OpenAI 開源的語音辨識模型,任何人都能免費拿去用。常見的用法有兩種:裝一個現成的前端 App(Mac 上的 MacWhisper 最多人用),或自己跑 whisper.cpp 這類本機版本。
最大的優勢是音檔完全不離開你的電腦——不是「我們承諾不看」,是它根本沒有伺服器可以傳。客戶的未公開素材、法務錄音、內部會議,這個特性沒有替代品。支援的語言也多,一百種以上。
訊號一:字幕檔能直接輸出,成品仍要校對
Whisper 的 官方命令列工具就能直接產生帶時間碼的 SRT/VTT,不必自己從逐字稿製作時間碼。上片前仍要校對文字、檢查斷句與時間,確認每句讀得完;若要字型、顏色、位置或燒進畫面,再接字幕工具或剪輯軟體。
這幾步用手做,一支十分鐘的影片通常比辨識本身還久。what'sub 做的就是這一段:語意斷句、句子編輯器、每句顯示秒數與每秒字數、樣式在網頁上調好、匯出 SRT/VTT/FCPXML 或直接燒錄。
訊號二:準的模型要好機器
模型分好幾個尺寸,官方提供的模型都免費,Medium/Large 等大模型也一樣。較大的模型通常需要更多記憶體與運算時間;實際準確度與速度要看素材、模型和電腦。部分第三方 App 會把模型存取或進階功能列入付費方案。
自己使用官方工具不需為大模型另付費,主要取捨是硬體、安裝和等待時間;選第三方 App 則再看它的方案與操作便利性。
訊號三:簡體與時間碼要自己收拾
中文使用者最常回報的兩件事:輸出可能是簡體字(模型版本不同表現不一),以及時間碼對不齊——尤其在小模型上。這兩件事都不難修,但每支影片都要修一次。
如果字幕是每週固定要交的東西,這種「每次都要收拾一輪」的成本會累積得比想像快。
一張表看完
左右滑動看完整比較,項目欄會留在左側。
| what'sub | Whisper | |
|---|---|---|
| 它是什麼 | 影片字幕工作流(聽打→斷句→樣式→匯出) | 開源語音辨識模型 |
| 費用 | 訂閱制 | 模型免費(部分前端 App 有付費版) |
| 安裝 | 瀏覽器打開就用 | 要裝 App 或自己架環境 |
| 音檔去哪 | 影片留在電腦,只送聲音辨識 | 完全不出電腦 |
| 語言 | 87 種可選,繁體中文是特化的那一種 | 一百種以上 |
| 繁體中文 | 聽打出來就是台灣用語的繁體 | 依模型,可能出簡體要自己轉 |
| 字幕檔輸出 | SRT/VTT/FCPXML | 官方命令列直接輸出 SRT/VTT,含時間碼 |
| 斷句 | 按語意切,可再拆併 | 依模型輸出,常要重切 |
| 字幕樣式 | 網頁上調好,可燒錄或匯出支援的樣式 | 沒有 |
| 帶進 Final Cut | FCPXML,樣式一起帶 | SRT 只有文字與時間碼 |
| 燒進影片 | 瀏覽器內直接燒 | 沒有 |
其實可以一起用
如果你已經有 Whisper 跑出來的 SRT,可以直接把它拖進 what'sub 的工作區當「修正字幕」——我們會告訴你它跟目前字幕差了幾句,也能把你改過的用詞收進自己的詞庫,之後辨識會優先認得。字幕做完再走樣式與匯出那一段。