
我的資料,我的 benchmark:幫演講筆記系統換一顆語音辨識引擎
引言:為什麼官方分數不夠用 我把演講錄影變成筆記的流程是這樣一條線:逐字稿 → 對應投影片 → 總整理。 這條線的地基是語音轉文字(automatic speech recognition,ASR)。它聽錯多少,後面每一層筆記就跟著錯多少。原本我用的是 OpenAI 的 Whisper large-v3。 這件事的起點,其實是我滑手機看到聯發科(MediaTek Research)發表台語模型 Breeze-ASR-26。 台語模型本身就夠讓人好奇了,但點進去才知道,原來他們去年就出過 Breeze-ASR-25,從 Whisper-large-v2 微調,專門針對台灣華語和中英夾雜優化,Apache 2.0 開源。醫學演講正好是中英夾雜的重災區,我居然錯過了一整年。 於是我同時面對兩顆模型,而它們的官方資料是完全不對稱的。 Breeze-ASR-25 給了一整張成績單,字錯率(word error rate,WER,越低越好): 資料集 Breeze-ASR-25 Whisper-large-v3 Whisper-large-v2 CSZS-zh-en(中英夾雜) 13.01 26.43 29.49 ASCEND-MIX(中英夾雜) 16.38 25.13 21.01 ASCEND-ZH(華語) 16.04 17.41 17.49 CommonVoice16-zh-TW(台灣華語) 7.97 8.95 9.84 ML-lecture-2021-long(長音檔演講) 4.98 6.41 6.13 (官方欄位寫的是 WLV3-Auto/WLV2-Auto,也就是開啟自動語言偵測的 Whisper。) 它連我當時在用的 large-v3 都贏,中英夾雜那兩列更是壓倒性。這部分我沒有必要再證明一次。 而 Breeze-ASR-26 呢?它只有台語一項成績——但那一項做得很紮實。 官方拿它跟四個系統比台語字元錯誤率(character error rate,CER,越低越好): 系統 台語 CER Breeze-ASR-26 30.13 教育部台灣台語輸入法 30.70 雅婷逐字稿 32.11 Google Gemini 3 Flash 32.52 Breeze-ASR-25 49.99 它在台語上贏了 Gemini 3 Flash,也贏了雅婷。 這是真本事,不該被忽略。 ...