保留來源語言逐字稿作為證據
你的訪談會以受訪當下使用的語言進行轉錄。原文逐字稿是引用依據,譯文則是分析素材。研究者引用回原文行做受訪者校核與 IRB 審查;記者在引述見報前會先驗證原文。
大多數轉錄產品是為英語客戶轉錄英語會議而打造的。翻譯功能(如果有的話)通常以另一個獨立計費的服務、影片創作者的字幕功能,或一個共用的點數池形式存在 — 而後者會懲罰那些把每樣東西都翻譯一遍的人。但多語訪談工作流需要三件事依序到位 — 準確的來源語言轉錄,讓原始引述站得住腳;流暢的翻譯,讓不懂來源語言的團隊能進行分析;雙語並列顯示,讓任何引述都能對照原文驗證。質性方法學中「三座冰山」回顧明確警告,不要只分析翻譯後的逐字稿。資深記者也提出同樣的主張:被引用的翻譯必須一字不差,不能是改寫。Vocova 把這兩個族群一直靠手工拼湊的工作流,做成了完整產品。
100+ 來源語言、140+ 翻譯語言對、能應付焦點團體與專家小組的說話者辨識。
你的訪談會以受訪當下使用的語言進行轉錄。原文逐字稿是引用依據,譯文則是分析素材。研究者引用回原文行做受訪者校核與 IRB 審查;記者在引述見報前會先驗證原文。
切換檢視畫面,逐行顯示來源語言與你的工作語言。一鍵將翻譯引述與原文對照驗證。Bearak 為與口譯員合作的記者所建議的驗證 UI — 也是 Lingard 等人為跨語言質性分析所建議的交叉檢核。
試用雙語字幕為 5 人以上焦點團體、雙人訪談、記者會與專家小組提供說話者標籤。將 Speaker 1 重新命名為實際的受訪者代號一次,整份逐字稿都會同步更新。每段都有時間戳,可在驗證引述時跳回來源音訊播放。
將提格里尼亞語翻成法語、粵語翻成葡語、中文翻成英文、西語翻成德語。不只是全球前 10 大語言。Otter 的轉錄上限是 4 種語言,且沒有真正的翻譯。Rev 的字幕涵蓋 17 種語言。Vocova 涵蓋長尾,因為真正的研究與真正的跨境新聞,就發生在那裡。
查看翻譯工具可匯出 DOCX 供 NVivo、ATLAS.ti、MAXQDA 與 Dedoose 匯入 — 說話者標籤一致,能讓 NVivo 的自動編碼正常運作。SRT 與 VTT 用於影片素材。PDF 用於存檔與 IRB 送審。純 TXT 與 CSV 用於下游腳本與試算表。
無論你是進行 90 分鐘焦點團體的研究者,還是明天就要交稿的記者,都是同樣的三步驟。
拖放 90 分鐘訪談檔案,或在有權處理時貼上 YouTube、X 或 Vimeo 的支援連結。100+ 來源語言會自動偵測。長篇內容沒有固定長度上限。
標記說話者、加上時間戳,以訪談當下錄音的語言呈現。將 Speaker 1 重新命名一次,標籤就會擴散到整份逐字稿。來源語言版本作為證據保留;要不要翻譯由你決定。
一鍵翻譯為 140+ 種目標語言對中的任一種。並列閱讀來源語言與工作語言,可在任何時間戳跳回音訊驗證引述,編輯任何需要修飾的內容,然後匯出 DOCX 供 CAQDAS 使用、SRT 或 VTT 用於影片、PDF 用於存檔。
可匯出 DOCX,且具有一致的說話者標籤(Speaker 1,可再重新命名)。NVivo 的自動編碼功能在這種格式下表現最佳;ATLAS.ti、MAXQDA 與 Dedoose 都支援匯入 DOCX(以及 TXT、RTF、PDF)。Vocova 並不產生原生 QDPX 交換檔 — 任何其他轉錄廠商也都沒有 — 但帶有乾淨說話者標籤的 DOCX 是業界標準的橋接格式。
多數質性方法學者建議引用原文引述,並附上英文對照譯文供不諳來源語言的讀者參考。Lingard、Schumann 等人的「三座冰山」回顧明確警告,不要只分析翻譯後的逐字稿。Vocova 同時保留兩種逐字稿,讓你能在引用級的原文行旁邊,並列分析級的英文譯文。
說話者辨識可處理跨語言的多位說話者。句中的語碼轉換則是所有自動轉錄工具的共同弱點 — 質性方法學文獻多年來持續提及這點。對於高度語碼轉換的音訊(西式英語、新加坡英語、印度英語、僑民訪談),我們建議在發表前進行雙語審閱以及人工驗證步驟。我們不會誇大 AI 在這方面的能力。
請保持謹慎。Whisper — 許多轉錄工具底層使用的模型 — 已被記錄會在約 1.4% 的段落產生幻覺,而其中 38% 的幻覺帶有明確危害,包括捏造姓名。雙語並列檢視與時間戳跳轉功能,正是為 Bearak 所建議的驗證步驟設計:「如果你要把某段話放進引號裡,那必須是精確翻譯,而不是改寫。」發表前請務必對照音訊驗證原文行。
可以,前提是來源受支援、可存取,且你有權處理。Vocova 支援 1,000+ URL 來源,包括 YouTube、TikTok、Reddit、X、Vimeo、Dailymotion、Bilibili 和 SoundCloud 等。如果公開連結被封鎖或無法存取,請改為上傳你自己儲存的檔案。
來源語言逐字稿與翻譯通常都在幾分鐘內完成 — 而不是過去手工流程每小時音訊需四到六小時。對於緊迫的新聞編輯室截稿時間,你能在下一次編輯會議前就準備好一份帶說話者辨識的雙語逐字稿。對研究而言,省下的時間能投入到反思與分析上,而不是打字。