簡短答案

廣東話會議轉錄,是把口語廣東話——通常夾雜英文與普通話——化成準確、附時間戳與講者標註的紀錄。對 AI 而言尤其困難,因為廣東話有六個聲調、極少按口語書寫,而且經常在句中中英夾雜。像 Oak 這類專門打造的引擎,以單一雙語模型、術語集與引用級時間戳,一併處理這三大難題。

全球約有 8,500 萬人講廣東話——遍及香港、澳門、廣東以至全球華人社區——是世界上使用人數最多的語言之一。然而,轉錄工具長期未能好好服務廣東話。部分原因屬技術層面:六個聲調、英文完全沒有對應的口語與書面語差距,以及一群會不自覺在句中切換英文與普通話的使用者。另一部分原因屬商業考慮——大部分轉錄研發集中於全球內容量較大的語言,令現成模型把廣東話視作次要。

本指南整理我們打造 Oak 廣東話優先架構的心得,以及要在香港團隊真實舉行的會議中,取得準確、可作決策依據的逐字稿,究竟需要甚麼:由處理中英夾雜的引擎,到一份逐字稿如何成為證據。

重點摘要

  • 是三個問題,不是一個。準確的廣東話轉錄,必須同時解決聲調、口語與書面語差距,以及中英夾雜——而非把它們當作附加功能逐一補上。
  • 中英夾雜是常態,不是例外。一句香港人的日常說話,例如個 dashboard 嘅 latency 而家高咗,就同時觸發一般模型的三種失誤;Oak 把廣東話與英文視為同一空間,毋須語言偵測器。
  • 語境決定意思。(蝕本)與(攝入去)等近音字會令句意完全相反;術語集配合語境解碼,多數情況都能在第一次就判斷正確。
  • 時間戳與講者標註,令逐字稿成為證據。精確到秒的引用級時間戳與持續講者身份,是逐字稿能在爭議、審計或事實核查中站得住腳的關鍵。
  • 要求對方公開基準。沒有數據、條件與量度方式的準確度數字並無意義——請要求按語言與音訊類型分列的字詞錯誤率(WER)與字元錯誤率(CER)。

本指南內容

這是支柱總覽。以下每一章深入處理廣東話轉錄問題的其中一環,並連結回本頁。你可按次序閱讀以掌握全貌,或直接跳到與你當前問題最相關的一章。

實例參考

Oak 廣播服務方案

閱讀本指南每個例子背後的客戶故事——專為香港媒體團隊調校的口語廣東話轉錄。

查看案例 →

一份差劣廣東話逐字稿的隱藏成本

把廣東話轉錄做好的理據,很容易被低估,因為做得不好的代價分散而少有量化。它首先反映在有人要人手清理機器逐字稿所花的時間——往往正是那位本應因自動化而省下工夫的初級同事。它接著反映在悄然流失的意思:那句解釋客戶為何不滿的廣東話旁白、那句從未寫進英文摘要的中英夾雜承諾、那個被寫錯而把虧損說成中性陳述的財務術語。單獨來看都不算嚴重,但合起來就意味着公司兩邊,在同一場對話上各自依據不同版本工作。

對受規管團隊而言,代價更為明顯。一份把口語廣東話悄悄改寫成正式書面中文的逐字稿,其實已作出日後可能引起爭議的編輯判斷;一份無法指出某句有爭議說話確切秒數的逐字稿,在審計中也幫不上忙。最重視廣東話轉錄的團隊——廣播機構、律師事務所、法定機構——正是那些一旦紀錄不準確或無法核實,就要承受實質後果的一群。因此本指南把準確、歸屬與可核實視為單一標準,而非三項可有可無的優點。

為何廣東話對 AI 特別難轉錄?

廣東話有聲調、偏口語,而且極少按所講的方式書寫。講者說嗰個,意思是「那一個」。銷售同事說我哋有個 quarterly target 要 hit,只認廣東話的模型就會在句子中途失手。受訪者用——一個是蝕本,一個是攝入去——不理解語境的模型就會選錯。把這些乘以 60 分鐘會議與三位講者,你就會得到一份無人用得着的逐字稿。

三股力量互相疊加,本指南每一章各處理其中一股:

  • 聲調與聲學。六個聲調意味着細微的音高差異就承載完全不同的意思,近音字亦處處皆是——正因如此,理解語境的引擎與術語集才如此重要。
  • 口語與書面語的差距。香港專業人士以口語廣東話交談,卻以正式中文書寫——所以「準確」轉錄同時也是一項翻譯取捨。詳見商業術語一章。
  • 中英夾雜。英文與普通話詞彙會毫無預警地出現在廣東話句子之中。詳見中英夾雜一章。

聲調與近音字

廣東話是有聲調的語言,共有六個聲調,即同一個音節會因音高不同而帶完全不同的意思。對聽者而言毫不費力;但對主要以無聲調語言訓練的模型來說,卻是持續的錯誤來源,因為兩個字之間的聲學差異,可能比一般會議室的背景噪音還要細微。結果就是一份佈滿近音字替換的逐字稿——那些字看似合理,卻不是講者所講的字。日常閒談中這鮮少要緊,但在董事會會議或法律程序中,一個寫錯的字就足以令句意完全相反。因此廣東話優先的引擎,必須把聲學建模與語境結合:在確定用字之前先衡量前後文,而非孤立地選出統計上最常見的選項。

口語與書面語的差距

英文並沒有與廣東話口語、書面語之間差距完全對應的現象。香港專業人士以口語廣東話交談——當中充滿語氣詞、縮略與少有寫下來的說法——但當要製作正式紀錄時,卻改用標準書面中文。因此一份逐字稿有兩個都說得通的目標,而一般模型通常落在兩者之間的尷尬位置:太口語,無法作正式紀錄存檔;太書面,又未能反映實際所講的話。Oak 的做法是忠實保留口語原貌,並在需要時提供清楚標示的書面版本,讓團隊自行決定紀錄採用哪種語域,而不是由工具悄悄替你決定。

中英夾雜作為預設語域

第三股力量,是外界最容易低估的一環。在香港的工作場所,把英文詞混入廣東話句子並非怪癖,也不代表語言能力不足——它就是專業場合的標準語域。技術名詞、產品名稱與商業動詞以英文出現,而語法框架保持廣東話,講者更會在一句之內來回切換數次而不自覺。任何把一種語言視為主、另一種視為例外的引擎,都會在每個切換點失手。唯一穩健的做法,是由一開始就把廣東話與英文視為同一空間,而這正是中英夾雜一章詳細解釋的內容。

一般轉錄工具與廣東話優先引擎的比較

大多數團隊在試過通用工具、拿到要人手清理的逐字稿之後,才會來到這裡。兩者的分別在於架構,而非表面功能:

功能廣東話優先引擎(Oak)一般以英文為主的工具
中英夾雜單一雙語模型,毋須偵測器;英文與廣東話視為同一詞彙空間語言偵測器延遲,令句中音訊誤導處理;英文名詞變成音譯亂碼
口語廣東話保留口語原貌,並可按需提供清楚標示的書面版本強行改寫成正式書面中文,意思流失
商業/法律術語按專案設定、由你的工作區擁有的術語集,並配合語境解碼把近音字化平或寫錯
時間戳引用級,精確到秒約略,僅到段落層級
講者身份以同意為前提的 Voice Memory,跨會議維持身份每次通話重新標記;靜默後便失去身份

各部分如何組合運作

之所以把這些能力寫成一份指南、而非五項獨立功能,是因為它們只有整套運作才有效。準確的廣東話轉錄是基礎:字詞出錯,其上建構的一切都會繼承這個錯誤。單一雙語模型在中英夾雜之間產出乾淨文字;術語集鎖定一般模型會化平的名稱與術語;講者分離把每一行歸屬正確的講者;秒級時間戳把每一行錨定到錄音。只有這四者到位,最後一步——把逐字稿化成會議紀錄與行動項目——才值得信賴。

反過來說,上游任何一環薄弱,下游都會顯現。一份弄錯中英夾雜句子的逐字稿,會產出遺漏當中決定的摘要。一份寫錯財務術語的逐字稿,會產出與實際共識相反的會議紀錄。一份失去講者身份的逐字稿,會產出無人能解決的歸屬爭議。因此本指南以整體角度看待問題:正在評估廣東話轉錄工具的團隊,應以自己的音訊測試整條鏈,而不只是看一眼標題上的準確度數字。

「可作決策依據」究竟是甚麼意思

本指南全篇把目標描述為可作決策依據的逐字稿,這一點值得說清楚。可作決策依據的逐字稿,是團隊毋須回去翻聽錄音核對,就能據以行動的逐字稿。實際上這需要同時具備三項特質。它必須準確——字詞正確,包括術語與中英夾雜的用字。它必須可歸屬——每一行都連繫到說話的人,並在整場會議中保持一致。它亦必須可核實——任何一行都能在幾秒內追溯回錄音的確切時刻,令爭議由證據而非記憶去解決。只具備第一項的逐字稿,是一份可讀的紀錄;三項齊備的逐字稿,才是你可以據以作決定、交付成果或確立法律立場的東西。本指南的一切,都是為了達到這個標準。

本指南適合誰閱讀

香港的營運人員:正在舉行雙語會議,並厭倦了清理差劣逐字稿。採購與資訊科技團隊:正在比較 AI 轉錄供應商。編採與後期製作人員:需要大量處理廣東話音訊。法律、合規與法定機構團隊:對他們而言逐字稿是紀錄,而非方便工具。

每篇文章都會連結回相關的 Oak 解決方案頁面,讓你看到這些技術如何應用於真實客戶問題——廣播機構、律師事務所、法定機構——而非抽象的功能宣稱。如你正在比較供應商,最有用的做法是取一段自己會議的真實錄音,保留當中的中英夾雜與內部詞彙,逐一放進你考慮的每個工具測試。當你在自己熟悉的音訊上看到結果,本指南所描述的差異便一目了然。

逐字稿一旦可靠,會帶來甚麼改變

當團隊不再與逐字稿角力,下游效益會迅速累積。最直接的是負責做會議紀錄的人重新拿回自己的工作:他毋須在會議中一邊聽一邊打字,而是全程參與,會後只花幾分鐘確認草稿。會議本身的質素亦會提升,因為原本埋首抄筆記的人,現在真正參與對話。第二個效益是紀錄變成大家真正會用的東西——可在工作區內搜尋、結構一致,而且可信到讓缺席的同事直接閱讀摘要,而毋須要求別人口頭複述。第三個較慢顯現的效益屬機構層面:一批可靠、可歸屬的逐字稿會累積成真正的知識庫,讓團隊在數月後仍能搜尋,確切釐清當時議定了甚麼、由誰議定。

如果底層逐字稿並不可靠,以上一切都不會發生。一個滿是錯誤逐字稿的可搜尋檔案庫,比沒有檔案庫更糟,因為它會給人虛假的信心。這正是整份指南的主線:價值不在於 AI 轉錄有多新穎,而在於產出是否足夠好、可供依據。往後各章各自解釋廣東話逐字稿為何可能未達標——以及要修正需要甚麼。

常見問題

為何廣東話比普通話或英文更難轉錄?

有三個原因疊加。廣東話有六個聲調,音高的細微差異會改變意思,近音字亦十分常見。它極少按所講的方式書寫——專業人士以口語廣東話交談,卻以正式中文書寫,令轉錄同時成為一項翻譯決定。加上香港講者會在句中切換英文(與普通話),令依賴單一語言假設的模型失手。此外,大部分轉錄研究都集中於內容量較大的語言,令廣東話的資源長期不足。

AI 能否轉錄同一句中夾雜廣東話與英文的會議?

可以,前提是模型專為此而設。一般工具把廣東話模型與英文模型接在語言偵測器之後,而偵測器在語言切換時會延遲,導致音訊被誤導處理。Oak 採用單一雙語模型、毋須偵測器,並以真實香港工作場所音訊訓練,因此能順暢處理像我哋下個 sprint 要 prioritise 邊個 feature? 這樣的句子——並保留英文詞的原本拼寫。詳見中英夾雜一章

工具如何令行業術語與名稱保持正確?

透過術語集,按專案套用,並由你自己的工作區擁有。團隊可預先載入公司名稱、產品名稱、縮寫、監管術語與內部簡稱;配合語境解碼,大多數術語歧義都能在第一次處理時解決。由於術語集由你的工作區擁有,律師事務所的特權術語會一直在你控制之下,不會變成別人的資產。詳見商業術語建立術語集

廣東話逐字稿可以用作官方或法律紀錄嗎?

可以,前提是它具備引用級證據。Oak 逐字稿的每一行都精確到秒附時間戳並標註講者,令合夥人、記者或合規人員可跳到任何一行背後的確切音訊。這正是把逐字稿由「粗略筆記」提升為「證據」的關鍵,也是法律與法定機構團隊倚重它的原因。詳見時間戳與講者識別

如何把廣東話逐字稿化成可用的會議紀錄?

先讓 Oak 生成結構化摘要,如會議類型有需要則套用範本,然後由人作簡短檢閱,確認行動項目與負責人。逐字稿是紀錄,會議紀錄是決定——大多數團隊卡住的地方是這個轉換步驟,而非模型本身。四步方法詳見由逐字稿到會議紀錄

同一個會議中的普通話與英文,Oak 也能處理嗎?

可以。香港的會議經常在廣東話與英文之外再加普通話,與區域夥伴開會時尤甚,而處理廣東話與英文切換的單一模型做法,同樣延伸至普通話段落。這令全員大會或多語言客戶通話能以一份連續逐字稿記錄,而毋須分三次處理。

應該如何評估廣東話轉錄供應商?

以自己的音訊測試整條鏈,而非只看標題上的準確度數字。取一段真實錄音,保留當中的中英夾雜與內部詞彙,然後檢查四點:字詞是否正確(包括術語)、每一行是否歸屬正確講者、能否由任何一行跳到錄音的確切秒數,以及供應商是否對照公開基準報告準確度。一個在乾淨錄音室樣本上表現良好的工具,仍可能在你真正需要轉錄的會議上失手。