Whisper 準確度基準測試 2026:我們用 12 種語言實測 large-v3、turbo 與 small
可重現的 Whisper 基準測試:我們在 FLEURS 測試集的 12 種語言上測量 large-v3、large-v3-turbo 與 small 的單詞錯誤率。1,749 筆轉錄、完整方法論,並附可下載的原始資料。
為了衡量開源 AI 轉錄在 2026 年究竟有多準確,我們執行了 1,749 筆轉錄。三個 Whisper 模型(large-v3、large-v3-turbo、small)分別在公開資料集 FLEURS 的 12 種語言中各轉錄 50 個語句。重點是:large-v3 在高資源歐洲語言達到約 3 到 6 個百分點的單詞錯誤率(西班牙文 2.9%、義大利文 3.2%、英文 4.1%),接近人工轉錄常被引用的區間。到了印地文攀升至 15.7%,埃及阿拉伯文則是 14.6%。在同一個模型內,最佳語言與最差語言的差距超過 5 倍,遠遠蓋過模型版本之間的差異。
平均值只講了故事的一半,因此本文也報告平均值所掩蓋的東西:在英文和義大利文,超過 60% 的句子逐字完美返回,而印地文和粵語只有 4%。而當較小的模型在困難語言上失敗時,它們並非優雅地失敗:我們在原始輸出中抓到四個教科書式的重複循環幻覺,全部來自 turbo 和 small,large-v3 一個也沒有。
本文的每一個數字都來自我們在 2026 年 7 月親自執行的測試,附有固定的亂數種子、公開的腳本,以及可下載的原始結果。你可以完整重現,或逐行核對我們的作業。
我們測了什麼、怎麼測
網路上幾乎所有轉錄準確度數字,都是從廠商頁面或其他文章複製而來,背後沒有測試。以下是我們的確切設定:
| 項目 | 設定 |
|---|---|
| 測試集 | Google FLEURS test split(公開學術資料集,朗讀語音) |
| 抽樣 | 各語言洗牌後 test split 的前 50 個語句(shuffle seed 42,可決定性),每種語言約 9 分鐘音訊 |
| 模型 | Whisper large-v3、large-v3-turbo、small(開源 MLX 轉換版) |
| 推論 | temperature 0、固定來源語言(不自動偵測)、不以先前文字做條件 |
| 正規化 | 與 Whisper 論文一致:英文用 EnglishTextNormalizer,其餘用 BasicTextNormalizer(透過 transformers) |
| 指標 | WER(單詞錯誤率);中文、日文、粵語的主要指標為 CER(字元錯誤率) |
| 軟體 | mlx-whisper 0.4.3、jiwer 4.0.0、transformers 5.11.0、datasets 3.6.0 |
| 硬體 | Apple M3、MLX 推論、fp16 |
| 測試日期 | 2026 年 7 月 |
這 12 種語言是為了涵蓋資源水準與書寫系統而挑選,而非為了討好模型:六種高資源歐洲語言、三種需要字元層級評分的無空格 CJK 語言,再加上韓文(黏著語,有空格)、印地文(天城文)和埃及阿拉伯文。
給要稽核原始檔的人一個抽樣細節:FLEURS 常收錄同一句子由不同說話者錄製的多筆音訊,共用一個句子 id。我們的續跑邏輯以句子 id 去重,因此英文 large-v3 格為 49 個語句而非 50 個;其餘每格皆為 50,總計 1,749 筆轉錄。
在表格之前,兩點誠實的提醒。第一,FLEURS 是朗讀語音:乾淨音訊、穩定節奏、單一說話者。真實會議與訪談的分數會明顯更差,因為背景雜訊、口音與說話者重疊都會推高錯誤率(實務上的緩解步驟見如何轉錄有雜訊的音訊)。請把這些數字當成各語言的上限,而非承諾。第二,每種語言 50 個語句是抽樣,不是完整測試集。個別數字帶有數個百分點的誤差,因此請讀量級與排序,而非小數。

結果:12 種語言、3 個模型
數字為 WER %,越低越好。日文、中文(普通話)、粵語(標 *)因不以空格分詞,數字為 CER %。
| 語言 | large-v3 | large-v3-turbo | small |
|---|---|---|---|
| 英文 | 4.1% | 4.7% | 6.6% |
| 西班牙文 | 2.9% | 3.3% | 6.5% |
| 法文 | 5.8% | 6.7% | 14.3% |
| 德文 | 4.6% | 6.0% | 12.8% |
| 義大利文 | 3.2% | 3.9% | 8.2% |
| 葡萄牙文 | 6.6% | 7.2% | 11.0% |
| 日文 * | 6.6% | 5.8% | 16.4% |
| 韓文 | 14.9% | 14.5% | 21.7% |
| 中文(普通話)* | 6.7% | 8.0% | 19.5% |
| 粵語 * | 10.5% | 43.3% | 不支援 |
| 印地文 | 15.7% | 22.3% | 42.4% |
| 阿拉伯文(埃及) | 14.6% | 16.1% | 32.7% |
三件事很突出。語言之間的差距遠大於模型之間的差距:同樣是 large-v3,西班牙文 2.9% 對印地文 15.7%。turbo 模型在六種歐洲語言只付出 0.3 到 1.4 個百分點的代價,但在印地文是 6.6 個百分點,而在粵語從 10.5% 崩到 43.3% CER。而 small 在高資源語言之外災難式劣化:印地文 42.4%、阿拉伯文 32.7%,讓它只能當預覽工具,而非交付成果。
「不支援」這一格是字面意思:粵語的 yue 語言符記是在 large-v3 世代才引入(官方模型卡在變更項目中列出「一個新的粵語語言符記」),因此上一世代的 small 模型直接拒絕這種語言。在我們的執行中,它拋出不支援語言的錯誤,這本身就是一個有用的資料點:在比較模型品質之前,先確認模型是否支援你的語言。
平均之外:大多數句子完美,一條尾巴不然
平均錯誤率把實際上高度偏斜的分布抹平了。以 large-v3 逐語言列出零錯誤轉錄的語句比例、中位數與第 90 百分位:
| 語言 | 零錯誤語句 | 中位數 | 第 90 百分位 |
|---|---|---|---|
| 英文 | 61% | 0.0% | 12.5% |
| 西班牙文 | 54% | 0.0% | 7.7% |
| 法文 | 38% | 4.3% | 12.5% |
| 德文 | 56% | 0.0% | 14.3% |
| 義大利文 | 62% | 0.0% | 10.5% |
| 葡萄牙文 | 42% | 3.7% | 18.8% |
| 日文 * | 36% | 3.2% | 15.8% |
| 韓文 | 34% | 13.7% | 35.3% |
| 中文(普通話)* | 40% | 3.0% | 17.8% |
| 粵語 * | 4% | 9.7% | 17.6% |
| 印地文 | 4% | 14.9% | 27.5% |
| 阿拉伯文(埃及) | 28% | 10.3% | 37.5% |
有兩種讀法很重要。在強勢語言中,中位數的語句是零錯誤:英文 4.1% 的平均幾乎全由少數較難的句子造成,這也是為什麼那裡的轉錄感覺近乎完美,只偶有瑕疵要修。而零錯誤比例這一欄,能把平均混為一談的語言分開:粵語(10.5%)與阿拉伯文(平均 14.6%)看起來比實際接近,但完美返回的粵語句子只有 4%,阿拉伯文則是 28%。如果你靠掃描壞掉的段落來校對,尾端百分位比平均更能預測你的工作量。

發現 1:語言差距蓋過模型差距
在 large-v3 內,最佳語言(西班牙文,2.9%)與最差語言(印地文,15.7%)之間的幅度超過 5 倍。英文(4.1%)對埃及阿拉伯文(14.6%)接近 4 倍。相對地,在單一歐洲語言內,從 turbo 升到 large-v3 只讓數字移動約一個百分點(英文 4.7% 到 4.1%,德文 6.0% 到 4.6%)。
在 small 上,這種不對稱更加銳利。在英文它只落後 large-v3 2.5 個百分點,但在法文從 5.8% 劣化到 14.3%,在印地文從 15.7% 劣化到 42.4%。在英文看似合理折衷的同一個 checkpoint,在印地文根本無法使用。
實務結論很直接:模型是否妥善支援你的語言,遠比你選哪個版本的模型重要。如果你用西班牙文工作,現代的東西幾乎都行。如果你用印地文或粵語工作,模型的選擇決定了轉錄是否根本能用。
發現 2:turbo 實際上讓你付出什麼代價
在我們的 M3 上,典型吞吐量在 large-v3 約為即時的 3.8 倍、turbo 為 5.2 倍、small 為 14.3 倍,為多次執行的平均(個別執行隨系統負載變動,絕對速度取決於硬體;訊號是比值)。所以 turbo 大約比 large-v3 快 1.4 倍。
在六種高資源歐洲語言,這個速度幾乎不用付出代價:turbo 平均只落後 large-v3 約 0.8 個百分點,而在日文和韓文,我們的樣本裡 turbo 甚至略勝 large-v3(5.8% 對 6.6% CER,14.5% 對 14.9% WER)。這正是商用轉錄服務大致轉向蒸餾與加速模型的原因。
但 turbo 並非白吃的午餐。印地文劣化 6.6 個百分點(22.3% 對 15.7%),埃及阿拉伯文 1.5 個百分點,而粵語從 10.5% 崩到 43.3% CER,等於無法使用。用準確度換速度的決定,必須逐語言做,而非一體適用。
發現 3:沒有詞界的語言需要換一把尺
中文、日文、粵語不以空格分詞,因此「單詞」錯誤率完全取決於你如何切分文字,不同的分詞器對相同的轉錄會得出天差地別的 WER。學術慣例(包括 Whisper 論文本身)是對這些語言使用字元錯誤率(CER),我們報告的也是它。
這樣衡量,日文(6.6% CER)與中文(6.7% CER)在 large-v3 上落在與強勢歐洲語言相同的品質帶。粵語是我們整個資料集中最鮮明的反例:large-v3 上 10.5% CER,turbo 上 43.3%,small 上完全不支援。一種語言、三個模型,結果從可用橫跨到不可能。
韓文值得一個註腳:它的 14.9% 看似不佳,但韓文是黏著語,採用會膨脹以空格為基礎之 WER 的分寫慣例,所以它的字元層級準確度優於數字給人的印象。它仍比歐洲語言需要更多校對,只是不像對 WER 的天真解讀所暗示的那麼多。
評估任何廠商時要記取的教訓是:如果某工具宣稱「中文 95% 準確度」,卻不說那是 WER 還是 CER、在什麼音訊上、用什麼正規化,這個數字不帶任何資訊。指標的機制在我們的 WER 解說中有詳細說明。

發現 4:較小的模型一旦失敗,就一次全垮
平均值讓人以為錯誤均勻散布在整份轉錄中。原始輸出說的是相反。我們掃描全部 1,749 個假設,尋找退化輸出(錯誤率超過 100%,或輸出超過參考長度兩倍),恰好找到四個案例:三個來自 turbo(兩個粵語、一個印地文),一個來自 small(印地文)。large-v3 在它全部 599 個語句中一個也沒有。
四個都是同一種失效方式:重複循環。最糟的粵語案例達到 372% CER(插入可把指標推過 100%):turbo 先合理地轉錄了開頭幾個字,接著卡在單一字元上,連續輸出了 46 次。印地文的失敗形狀相同,一個詞被反覆蓋印。在完全相同的語句上,large-v3 產出了 6.9% CER 的近乎完美轉錄。確切字串在原始資料中(results.jsonl 的語句 id 1980),想檢視的話可以去看。
那個粵語案例悄悄顯示了第二個失敗:在進入循環之前,turbo 已經從繁體中文漂移到簡體字與普通話用詞,而 large-v3 停留在參考的書寫系統。對粵語使用者來說,這和錯誤率一樣重要,因為「轉錄」正滑向另一種書面語言。
Whisper 系列模型的幻覺,在我們的樣本之外也有記載:Koenecke et al. (2024) 稽核 Whisper 的轉錄,發現約 1% 的片段含有捏造內容,集中在停頓與不流暢語音的周邊。我們在朗讀語音上的比率較低(1,749 筆中 4 筆,約 0.2%),這相符:乾淨、連續的音訊讓模型可填補的靜默較少。我們從兩者取得的實務規則是:最糟的轉錄失敗不是均勻分布的雜訊,而是局部的完全崩壞,它們集中在較弱語言的較小 checkpoint 上,而快速掃描重複符記就能抓住其中大多數。
我們的 large-v3 數字與已發表的 large-v2 表如何比較
我們的語言別準確度指南彙整了 Whisper 論文發表的 large-v2 FLEURS 結果。把它們與我們 2026 年 7 月的 large-v3 量測就重疊語言並列(論文數字是完整 test split,我們的是 50 語句樣本,因此請讀方向而非小數):
| 語言 | 論文 large-v2 | 我們的 large-v3 | 方向 |
|---|---|---|---|
| 西班牙文 | 3.0% | 2.9% | 持平,已然強勢 |
| 英文 | 4.2% | 4.1% | 持平,已然強勢 |
| 義大利文 | 4.0% | 3.2% | 略有改善 |
| 德文 | 4.5% | 4.6% | 持平 |
| 法文 | 8.3% | 5.8% | 改善 |
| 日文(CER) | 5.3% | 6.6% | 誤差範圍內持平 |
| 韓文 | 14.3% | 14.9% | 誤差範圍內持平 |
| 中文(普通話, CER) | 14.7% | 6.7% | 減半 |
| 阿拉伯文 | 16.0% | 14.6% | 略有改善 |
| 印地文 | 21.5% | 15.7% | 明顯改善 |
這個模式與額外訓練資料的去向一致:已接近自身下限的語言原地不動,而重大進步落在中文(減半)、印地文和法文。粵語在 large-v2 表裡根本不存在,這是同一個故事最直白的版本:在模型世代之間,對某些語言而言最重要的改變不是更低的錯誤率,而是存在本身。
這些數字對你的工作意味著什麼
把錯誤率翻成體感:5% 是每 20 個詞錯一個,快速校對即可。15% 是每 7 個詞錯一個,編輯開始耗費真實時間。超過 30%,整段需要重聽,轉錄頂多是草稿。
- 高資源歐洲語言(英文、西班牙文、法文、德文、義大利文、葡萄牙文): large-v3 在乾淨語音落在 3 到 7 個百分點,穩穩處於「先信任初稿,再略讀」的範圍。turbo 的代價不到 1.5 個百分點,日常工作綽綽有餘。small 在法文和德文劣化到 13 到 14 個百分點;任何要交付的東西都別用它。
- 日文、中文、韓文: large-v3 上 6 到 7 個百分點 CER 的日文與中文,只要你把數字讀成字元層級,初稿可信。韓文的 WER 高估了它的錯誤,但要比歐洲組多預留一些校對。
- 粵語、印地文、阿拉伯文: 謹慎區。印地文與埃及阿拉伯文即使在 large-v3 也落在 15 到 16 個百分點,每 6 或 7 個詞錯一個,因此要編列實質的編輯。粵語只在 large-v3 上可行;選錯變體,錯誤率就翻四倍。
請記住,這一切都是朗讀語音的上限表現。真實錄音分數更差,最重要的三個變數是錄音品質、說話者人數與口音強度。多說話者素材中,說話者歸屬是疊加在單詞準確度之上的另一類錯誤;其運作原理見什麼是說話者分離。
如果你想要的是約 100 種語言、而非我們這 12 種的逐語言全貌,我們的語言別準確度指南彙整了 Whisper 論文發表的 FLEURS 表,從近乎人工分級到實際上無法使用。那個頁面是已發表結果的彙整;這個頁面是我們親自跑的基準,兩者在重疊處一致。
重現它,或核對我們的作業
驗證或延伸這個基準所需的一切都是公開的:
- results.jsonl:全部 1,749 筆語句層級結果,附參考文字、模型輸出,以及每筆語句的 WER/CER
- results-summary.csv:本文背後的語言 x 模型彙整表
- bench.py:產生資料的確切腳本,採可決定性抽樣(seed 42)
- 資料包 README:安裝指令、版本與授權
執行 python bench.py --n 50,由於 shuffle seed 固定,你會選到和我們相同的語句;增加 --n 可擴大樣本(FLEURS test split 每種語言約有 350 到 900 個語句)。腳本從 Hugging Face 串流 FLEURS,在本機轉錄,以 Whisper 論文的正規化評分,並為每個語句附上一行 JSONL,因此中斷的執行可乾淨續跑。
出處說明:參考轉錄來自 Google 的 FLEURS 資料集(Conneau et al., 2022),依其 CC-BY-4.0 授權重新散布。Whisper 模型權重為 OpenAI 所有,以 Apache 2.0 釋出。
常見問題
Whisper 是目前最準確的開源轉錄模型嗎?
它是被重現最多、語言覆蓋最廣的開源家族,因此是很好的公開基線。還有其他開源家族,包括 Meta 的 MMS 與 Seamless 系列以及許多語言專屬的微調,但它們在語言覆蓋、授權與評估慣例上各不相同,因此跨家族的公平比較需要自成一套受控測試。我們選 Whisper,是因為權重固定且公開、結果可重現,而且一套方法就能涵蓋全部 12 種語言。
為什麼不測 Otter、Rev、HappyScribe 這類商用服務?
商用服務條款普遍限制發布基準測試結果,API 背後的模型不透明且說改就改,今天量到的數字下一季可能就沒有意義。開源權重是凍結的,因此任何人都能無限次重跑我們的確切測試。廠商的準確度宣稱都在各自網站上;請留意它們多麼少見地揭露測試集與正規化。
每種語言 50 個語句夠嗎?
對量級與排序夠了,對細緻的顯著性檢定不夠。我們正是這樣呈現結果的。FLEURS 完整 test split 每種語言約有 350 到 900 個語句,而擴大樣本只是公開腳本中一個參數的更動。
朗讀語音的結果能代表真實錄音嗎?
不能。我們在這裡量測的一切都是上限表現:乾淨、單一說話者、節奏穩定的音訊。在真實會議、通話與訪談中,隨著雜訊、口音強度與說話者重疊增加,損害會加大,請預期明顯更高的錯誤率。從這個基準能轉移到真實世界的是排序(在乾淨語音上勝出的語言或模型,通常在雜亂語音上也勝出),而非絕對百分比。
我要如何確切重現這個測試?
下載 bench.py,安裝資料包 README中列出的相依套件,然後執行 python bench.py --n 50。種子固定在腳本中,抽樣是可決定性的,結果會附加到中斷後可續跑的 JSONL 檔。腳本使用 MLX(Apple Silicon);在其他硬體上,把轉錄呼叫換成設定相同的 openai-whisper 或 faster-whisper。
這些模型會產生幻覺嗎?
在我們的朗讀語音樣本中,很少,但一旦發生就是災難性的:1,749 筆輸出中有 4 筆(約 0.2%)是重複循環,全部來自 turbo 或 small 的粵語與印地文,large-v3 沒有。針對對話式與不流暢語音的公開稽核報告出更高的比率,約為片段的 1%(Koenecke et al., 2024)。在有長停頓的真實音訊上,請預期更多此類情形,並掃描輸出中的重複符記。
Vocova 用的是哪個模型?
這個基準衡量的是開源模型,而非 Vocova 的生產管線,它帶出的重點是通則性的:你的語言是否被妥善支援,比模型的版本號更重要。Vocova 在多語言工作中把轉錄導向高準確度的模型層級,並在其上加入說話者標籤、翻譯與匯出格式。最直接的證據,是用你自己的語言、你自己的音訊跑一次測試。
參考資料與延伸閱讀
- FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech(Conneau et al., 2022),我們所有樣本的來源資料集
- Hugging Face 上的 google/fleurs,資料集散布與 CC-BY-4.0 授權
- Robust Speech Recognition via Large-Scale Weak Supervision(Radford et al., 2022),我們在正規化與 CER 慣例上所依循的 Whisper 論文
- openai/whisper-large-v3 模型卡,記載 large-v3 新增的粵語語言符記與 Apache 2.0 權重授權
- Careless Whisper: Speech-to-Text Hallucination Harms(Koenecke et al., 2024),我們用來比對失敗計數的 Whisper 幻覺率外部稽核
- PyPI 上的 mlx-whisper,本基準使用的推論執行環境
- GitHub 上的 jiwer,WER/CER 評分函式庫
想用你自己的素材看看多語言轉錄的實際效果嗎?把音訊或影片連結貼到 Vocova,再拿輸出對照本文對你語言的預期。
