来客网

Google推Gemini 3.5 Transcribe AI語音轉文字更精準

声明:本文转载自 「TVBS新闻网」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

Google推出新一代語音轉文字模型Gemini 3.5 Transcribe,主打更精準的語音辨識及文字整理能力,可自動去除「嗯」、「呃」等口頭禪,處理自我修正、專業術語及多種口音,並支援超過85種語言。Google表示,新模型可用於即時語音互動、會議紀錄、通話分析及語音輸入等應用。

到科技圓桌討論,聽聽專家怎麼說 >(圖/翻攝自Google官網)Gemini 3.5轉錄功能可透過智慧型轉錄功能清除語音不流暢之處。(圖/翻攝自Google官網)

Gemini 3.5 Transcribe提升語音辨識

Google表示,Gemini 3.5 Transcribe能直接將原始語音轉換成經過整理及格式化的文字,不僅辨識說話內容,也能理解自然語言中的停頓、自我修正及口語表達。

例如使用者說「我們週二見,不,週三」,模型能辨識說話者的自我修正,將內容整理為修正後的文字。此外,模型也能移除「嗯」、「呃」等填充詞,並依照語意自動整理文字格式。

到科技圓桌討論,聽聽專家怎麼說 >

根據Artificial Analysis測試,Gemini 3.5 Transcribe在即時串流情境下的字詞錯誤率(Word Error Rate,WER)為4.0%,非即時處理則為2.6%。Google表示,相較於前一代Chirp 3,模型的最終文字輸出延遲時間降低約70%。

模型也能辨識使用者提供的自訂詞彙,包括專業術語及特殊拼寫,並可在預錄音訊中辨識最多3名說話者,為不同發言內容標記時間戳。

支援超過85種語言

Gemini 3.5 Transcribe可自動偵測並轉錄超過85種語言,並針對不同地區的口音及方言進行處理。Google表示,在FLEURS多語言基準測試中,新模型的表現也優於Chirp 3。

(圖/翻攝自Google官網)FLEURS多語言基準測試中,新模型的表現優於Chirp 3。(圖/翻攝自Google官網)

Google也將Gemini 3.5 Transcribe應用於旗下多項產品。在Android版Gboard中,新的Rambler功能可將語音轉換成格式完整的文字,使用者也能直接透過語音修正錯字或改變文字風格。

在macOS版Gemini中,使用者則能透過語音下達指令,讓Gemini結合螢幕內容及其他Gemini模型,完成檔案摘要、文字改寫及圖片生成等工作。

開放開發者及企業使用

Google表示,Gemini 3.5 Transcribe目前已透過Gemini API在Google AI Studio及Google Antigravity開放公開預覽,企業則可透過Gemini Enterprise Agent Platform公開預覽使用,未來也將整合至Gemini Enterprise for Customer Experience。

開發者可透過Live API使用即時串流版本,支援低於1秒的延遲;預錄音訊則可透過Interactions API進行轉錄,適用於會議、通話紀錄及其他音訊內容。

目前Gemini 3.5 Transcribe已在macOS版Gemini以英文推出,Android版Rambler則先於部分國家及語言提供。Google也表示,Chrome語音輸入功能將於未來推出,讓使用者能直接在網頁欄位以語音輸入文字。

评论 (0)