簡短答案

中英夾雜是在同一句說話中混用兩種語言——在香港,就是廣東話與英文。大多數引擎失手,是因為語言偵測器在語言切換時會延遲,把音訊送到錯誤的模型。Oak 採用單一雙語模型、毋須偵測器:把兩種語言視為同一空間,並保留英文詞的正確拼寫,第一次就產出乾淨的逐字稿。

中英夾雜並非香港會議的怪癖——它就是預設模式。產品經理會一口氣說出個 dashboard 嘅 latency 而家高咗,並預期你跟得上。對大多數轉錄引擎而言,單單這一句就疊加了三種失誤:一個廣東話語氣詞、一個英文名詞,以及一個廣東話動詞結構。模型必須實時作出聲調、詞彙與拼寫的判斷——而大多數都做不到。

重點摘要

  • 中英夾雜在香港是常態。英文名詞與動詞不斷出現在廣東話語法之中,在產品、銷售、財務與科技會議尤其明顯。
  • 偵測器是最弱一環。拼接而成的引擎依賴語言偵測層,而它在語言切換時會延遲,令音訊誤導處理、輸出受損。
  • 一個模型勝過兩個。共用聲學前端的單一雙語模型沒有交接點,因此在切換之際仍能保持順暢。
  • 英文保持英文。好的引擎會保留英文詞的原本拼寫(dashboard,而非「大薯波」),而不是把它音譯得亂七八糟。
  • 真實音訊很重要。以真實香港工作場所錄音——而非乾淨錄音室音訊——訓練,才能讓模型學會專業人士真正的說話方式。

甚麼是中英夾雜?

中英夾雜是在同一場對話——往往是同一句說話——之中交替使用兩種或以上語言。在香港,主流模式是以廣東話語法為框架,中間放入英文的實詞:名詞、動詞與技術術語借自英文,而語氣詞、代詞與句子結構保持廣東話。這不是「差」的廣東話,也不是「破碎」的英文;它是專業人士不假思索便運用的一種穩定而流利的語域。任何想轉錄香港會議的工具,都必須把它視為基準情況,而非邊緣個案。

大多數引擎會出甚麼問題

大多數通用模型以單語語料訓練,再以語言偵測層拼接起來。當語言在句中切換時,偵測器會延遲半秒,令錯誤的子模型收到音訊。結果就是一份英文名詞被音譯成廣東話(dashboard 變成「大薯波」)、或廣東話語氣詞被羅馬拼音化成亂碼的逐字稿。無論哪一種,逐字稿都必須人手處理一遍才能使用——這就完全失去自動化的意義。

Oak 的不同之處

Oak 採用單一雙語模型,其共用聲學前端專門以香港工作場所音訊訓練。沒有獨立的語言偵測器會延遲或誤判——模型把廣東話與英文視為同一空間,並按意義而非語言劃分詞彙單位。由於聲學前端共用,兩個子模型之間並不存在會令逐字稿斷裂的交接點。當講者中英夾雜時,模型只會順暢地繼續。而且由於它以真實會議錄音(在取得同意下)訓練,而非只用乾淨錄音室音訊,它聽過香港專業人士真正的說話方式——包括半吞的語氣詞、快速帶出的英文名詞,一應俱全。

實例解析

以下這類句子,充滿香港人平常的工作日。每個例子中,單語模型都會以可預期的方式失手,而單一雙語模型則能保住原意。

產品會議

我哋下個 sprint 要 prioritise 邊個 feature?

單語廣東話模型會完全漏掉那三個英文詞,或憑空生出廣東話替代字。單語英文模型則會回覆亂碼。Oak 保留 sprintprioritisefeature 的原本拼寫,並在其周圍產出乾淨的廣東話,附精確到秒的時間戳。

客戶成功通話

個 client 話佢個 account 嘅 renewal 想 hold 住先,等佢哋 budget approve 咗。

那些英文商業名詞(clientaccountrenewalbudget)與動詞 hold 是承載意思的關鍵字——它們撐起整張工單的意思。依賴偵測器的引擎只要弄錯其中一個,「續約暫緩、待預算批出」就會變成噪音。單一模型的做法保留每個英文術語,讓下一更的客服人員讀到的,正是實際發生過的事。

財務討論

個 cap table 要 update,因為 round 嘅 valuation 仲未 finalise。

Cap tablevaluationfinalise 正是一般模型會化平或聽錯的術語——而在財務領域,錯一個就足以改變紀錄。配合你團隊的術語集(詳見商業術語),模型會鎖定這些術語,令它們每次都準確轉錄,而不是只在音質乾淨時才準確。

每個例子單獨看來只是小小的勝利,直到你意識到:這幾乎是全城每個工作會議的句式結構。把中英夾雜處理好,後續流程——會議紀錄與下游的 AI 摘要——才有紮實的基礎可依。

單一雙語模型與依賴偵測器的流程比較

行為單一雙語模型(Oak)依賴偵測器的流程
句中切換順暢繼續;沒有會失手的交接點偵測器延遲;錯誤的子模型收到音訊
英文名詞保留原本拼寫音譯得亂七八糟(dashboard → 大薯波)
廣東話語氣詞以口語廣東話呈現羅馬拼音化成亂碼
訓練資料真實香港工作場所音訊,並已取得同意乾淨的單語錄音室語料
人手清理極少;只需檢閱而非重寫大部分句子都需要

這項技術在產品中的應用

這項工作驅動着你在廣播服務電視台,以至日常銷售及客戶會議流程中所見的廣東話轉錄。同一個引擎,按不同用途疊加不同範本。

實例參考

Oak 廣播服務方案

採用本文所述流程的實際客戶部署。

查看方案 →

常見問題

香港會議中的「中英夾雜」是甚麼?

就是在同一句說話中混用廣東話與英文——通常以廣東話語法為框架,中間放入英文名詞、動詞與技術術語。在香港,這是預設的專業語域而非例外,所以轉錄必須把它當作基準情況處理。

為何大多數轉錄工具在中英夾雜的說話上失手?

因為它們把獨立的廣東話模型與英文模型接在語言偵測器之後。當講者在句中切換語言時,偵測器會延遲一瞬,把音訊送到錯誤的模型,於是英文名詞被音譯成廣東話,廣東話語氣詞變成亂碼。逐字稿之後便需要人手處理一遍才能使用。

Oak 如何準確轉錄中英夾雜的句子?

它採用共用聲學前端、毋須語言偵測器的單一雙語模型,並以真實香港工作場所音訊訓練。只有一個模型,就沒有會失手的交接點,因此能在切換之際保持順暢,保留英文詞的原本拼寫,並以口語呈現周圍的廣東話——同時附精確到秒的時間戳。

英文技術術語在逐字稿中會保留英文嗎?

會。像 dashboardsprintcap tablerenewal 等字詞都會保留原本的英文拼寫,而不會轉換成音譯廣東話。再配合你團隊的術語集,即可鎖定團隊專屬術語,令它們每次都準確轉錄。

中英夾雜同樣影響普通話嗎?

香港的會議經常加入普通話作為第三種語言,與區域夥伴開會時尤甚。處理廣東話與英文切換的同一套單一模型做法,同樣延伸至普通話段落,因此全員大會與雙語會議都能以一份逐字稿記錄。詳見香港雙語會議