簡短答案

講者分離把音訊拆成「誰說了甚麼」的片段,時間戳則把每一行錨定到準確時刻——兩者合起來回答「誰說」與「何時說」。大多數引擎每次通話都要重新標記講者,或在停頓後便失去身份。Oak 令講者身份跨會議保持一致,並為每一行加上精確到秒的時間戳,讓任何人都能跳到某句引述背後的音訊。

大多數團隊會先問「逐字稿準確嗎?」,然後才問「這句是誰說的、幾時說的?」而後者,才是決定一份逐字稿能否在客戶爭議、審計或記者事實核查中站得住腳的關鍵。準確度給你一份可讀的紀錄;講者分離與時間戳,才給你一份站得住腳的紀錄。

重點摘要

  • 講者分離回答「誰」,時間戳回答「何時」。兩者都是獨立於轉錄的工作,而逐字稿要經得起查證,兩者缺一不可。
  • 講者分離與轉錄是兩個不同模型。它不理字詞,只追蹤聲紋變化,並須處理重疊發言、插話與聲音相似的講者。
  • 大多數引擎在停頓後便失去身份。講者一度沉默再開口,往往會被標記成新的人,令紀錄碎裂。
  • 以同意為前提的持續講者記憶可解決問題。Oak 會學習你團隊的聲音、跨會議維持標記,並把新參加者標為「講者」,直至你確認其身份。
  • 精確到秒的時間戳令逐字稿成為證據。當有人說「我沒有這樣說過」,你可直接跳到錄音的確切秒數——毋須捲動,毋須人手定位。

甚麼是講者分離?

講者分離是把音訊拆成「誰說了甚麼」片段的工作。它與轉錄並行,但屬另一個模型:它不在乎字詞,只在乎聲紋變化——那個把一位講者與另一位區分開來的聲學特徵。良好的講者分離能處理發言重疊、短暫插話,以至在不同裝置錄下、聽起來相似的聲音。它的輸出,正是令逐字稿能把每一行歸屬具名人物、而非匿名「講者 1」的關鍵。

為何大多數引擎會弄錯講者身份

兩種失誤十分常見,而且都會削弱紀錄的可信度:

  • 跨通話身份外洩。部分講者分離工具會未經許可就在不同通話之間套用同一身份,實際上等於在本應互相隔離的會議之間共用聲紋資料。
  • 沉默後失去身份。當講者沉默超過一分鐘再重新發言,不少引擎會把他標記成全新的人——於是一位參加者被拆成兩、三個標籤,紀錄隨之碎裂。

Oak 如何處理講者識別

Oak 的持續講者模型(現稱 Voice Memory)以工作區為範圍:它在取得同意下學習你團隊的聲音,並跨會議維持標記。毋須每次通話重新標記,因此經常出現的參加者能一次又一次被認得。當有新參加者加入,他會被標為「講者」,直至你確認其身份。最重要的是,聲紋只留在你的工作區內,永不會用於訓練共用模型——那些令你的逐字稿有價值的講者身份,不會變成別人的訓練資料。這與以工作區為範圍的術語集背後,是同一套隔離原則。

為何引用級時間戳如此重要

Oak 逐字稿的每一行都精確到秒附時間戳。當有人爭議「我沒有這樣說過」,合夥人、記者或合規人員可直接跳到該確切秒數的音訊——毋須捲動,毋須人手定位。這正是把逐字稿由「粗略筆記」提升為「證據」的機制,也是時間戳並非裝飾功能、而是審計軌跡骨幹的原因。在雙語程序中,官方紀錄需要兩種語言都完整無缺,而同一套秒級錨定,讓檢閱者能就任何一行核對原始音訊。

講者分離與時間戳:一般引擎與 Oak 的比較

功能Oak一般引擎
跨會議的講者身份學習一次,跨會議保持一致(已取得同意)每次通話重新標為講者 1、2、3……
講者停頓後重新發言重新對應回同一身份往往被標記成新的人
新參加者標為「講者」,直至你確認悄悄自行指派身份
聲紋資料只留在你的工作區;永不訓練共用模型可能跨會議共用,或用於訓練共用模型
時間戳精確度每一行都精確到秒約略,僅到段落層級
爭議處理由任何一行跳到背後的確切秒數要人手捲動尋找該時刻

這項功能的應用場景

最明顯是法律法定機構部署,當中音訊軌跡必須站得住腳——會議紀錄會成為個案或公開紀錄的一部分,而有爭議的一句話必須能在幾秒內對照原始音訊核實。

實例參考

Oak 法律界方案

採用本文所述流程的實際客戶部署。

查看方案 →

常見問題

轉錄與講者分離有何分別?

轉錄把說話化成文字——處理字詞。講者分離把音訊拆成「誰說了甚麼」的片段——處理講者。兩者是不同模型:轉錄在乎字詞,講者分離只在乎聲紋變化。逐字稿需要兩者兼備,才能把每一行歸屬具名人物,而非匿名「講者 1」。

為何我的轉錄工具不斷把同一位講者重新標記?

因為不少講者分離工具在停頓後便失去講者身份。當有人沉默超過一分鐘再加入發言,引擎會把他標成新的人,於是一位參加者被拆成幾個標籤。Oak 以一致、且以同意為前提的講者身份,跨整場會議與跨會議維持標記,避免這個問題。

Oak 如何令講者身份跨會議保持一致?

透過以工作區為範圍的講者模型:它在取得同意下學習你團隊的聲音,並由一個會議延續到下一個——毋須每次通話重新標記。新參加者會標為「講者」直至你確認,而聲紋只留在你的工作區內,永不用於訓練共用模型。

「引用級」或「精確到秒」的時間戳是甚麼意思?

意思是逐字稿的每一行都錨定到錄音中的準確秒數,讓你點擊任何一行即可直接跳到該時刻的音訊。當某句陳述受爭議,檢閱者可在幾秒內對照原始音訊核實,毋須捲動或人手定位——這正是令逐字稿可作證據使用的關鍵。

時間戳與講者標註,足以構成法律或審計紀錄嗎?

它們是基礎。秒級時間戳加上一致的講者歸屬,讓合夥人、審計師或合規人員可把任何一行追溯回原始音訊——這正是令逐字稿成為證據、而非僅是筆記的關鍵。至於完整可供審計的流程,還取決於你自己的資料保留與存取政策,應對照你的監管責任加以確認。