Google近日推出全新語音轉文字模型「Gemini 3.5 Transcribe」,加入智慧轉錄功能,不僅能聽打,還會直接把凌亂口語整理成容易閱讀的逐字稿,同時刪除「嗯、啊、呃」等語助詞,還會修正重複、口吃與說到一半改口的內容,不過台灣用戶目前尚未能在一般Gemini介面中全面使用。
Gemini 3.5 Transcribe加入智慧轉錄模式,傳統語音辨識通常會把說話內容原封不動記下來,新模型則會理解使用者真正想表達的意思,自動刪除「嗯」、「啊」、「呃」等填充詞,也能整理口吃、重複字句及說到一半重新開始的內容。例如使用者說:「我們星期二開會,等等,不對,改成星期三下午兩點。」系統最後可直接整理為「我們星期三下午2點開會」,不必事後逐字刪除錯誤內容。
▲Gemini 3.5 Transcribe支援即時轉錄及多語言辨識,使用者在同一段內容中切換語言,系統也能接續辨識。(圖/翻攝自Google)
Google官方說明除了修飾口語,Gemini還能自動補上標點符號、大小寫及段落;若使用者口述多個項目,系統也能整理成編號或項目符號,並將日期、時間、貨幣及數字轉換成較容易閱讀的格式。
想保留原話也可以
對部分產業的人來說,逐字稿有時必須完整保留受訪者原話,不能讓AI擅自修飾,因此Gemini 3.5 Transcribe除了智慧轉錄,也提供「verbatim」忠實轉錄模式,保留語助詞、重複內容、停頓及說錯後重新修正的過程。若只是整理會議紀錄、口述文章或工作筆記,可選擇智慧轉錄;若用於新聞採訪、證詞、研究訪談等講究原始語意的情境,仍應使用忠實轉錄,並回聽錄音確認,以免AI整理後改變語氣或語意。
支援85種以上語言、可分辨最多3名說話者
Google表示,新模型可自動偵測超過85種語言,能處理口音、方言及對話途中切換語言的情況;預錄音檔還支援講者辨識,最多可標示3名說話者,並提供逐字時間戳記。使用者也能加入最多1000個自訂詞彙,讓系統預先掌握人名、品牌、專有名詞及特殊拼法,降低採訪逐字稿最常遇到的同音字與專業術語辨識錯誤。
台灣現在可以用嗎?一般Gemini尚未全面開放
Gemini 3.5 Transcribe目前主要開放給開發者透過Gemini API、Google AI Studio及Google Antigravity使用,並已導入Android部分地區的Gboard「Rambler」功能,以及macOS版Gemini App的「Speak to Window」語音輸入功能,未來也將加入Chrome,台灣用戶現階段可能還無法直接使用。
▲Gemini 3.5 Transcribe提供「忠實轉錄」與「智慧轉錄」模式,後者可自動刪除「嗯、啊」等贅詞,並處理口吃、重複及說到一半改口的內容。(圖/翻攝自Google)
我是廣告 請繼續往下閱讀
想保留原話也可以
對部分產業的人來說,逐字稿有時必須完整保留受訪者原話,不能讓AI擅自修飾,因此Gemini 3.5 Transcribe除了智慧轉錄,也提供「verbatim」忠實轉錄模式,保留語助詞、重複內容、停頓及說錯後重新修正的過程。若只是整理會議紀錄、口述文章或工作筆記,可選擇智慧轉錄;若用於新聞採訪、證詞、研究訪談等講究原始語意的情境,仍應使用忠實轉錄,並回聽錄音確認,以免AI整理後改變語氣或語意。
支援85種以上語言、可分辨最多3名說話者
Google表示,新模型可自動偵測超過85種語言,能處理口音、方言及對話途中切換語言的情況;預錄音檔還支援講者辨識,最多可標示3名說話者,並提供逐字時間戳記。使用者也能加入最多1000個自訂詞彙,讓系統預先掌握人名、品牌、專有名詞及特殊拼法,降低採訪逐字稿最常遇到的同音字與專業術語辨識錯誤。
台灣現在可以用嗎?一般Gemini尚未全面開放
Gemini 3.5 Transcribe目前主要開放給開發者透過Gemini API、Google AI Studio及Google Antigravity使用,並已導入Android部分地區的Gboard「Rambler」功能,以及macOS版Gemini App的「Speak to Window」語音輸入功能,未來也將加入Chrome,台灣用戶現階段可能還無法直接使用。