Google 於自家部落格上,宣布推出新一代語音轉文字模型「Gemini 3.5 Transcribe」。相較傳統語音辨識技術在雜音干擾或專業術語場景下的高錯誤率,該模型能直接將原始音訊轉化為精確且排版工整的文字內容。
根據 Artificial Analysis 實測數據,Gemini 3.5 Transcribe 在流式與非流式架構下的平均字詞錯誤率(WER)分別降至 4.0% 與 2.6%,在 FLEURS 多語言基準測試中亦繳出 5.50% 與 5.04% 的成績,整體表現大幅超越前代 Chirp 3,最終轉寫耗時更縮短達 70%。
在核心功能方面,該模型具備智慧語意修正能力,可自動過濾語助詞並辨識說話者的口誤更正;同時支援函式呼叫(Function Calling),能將圖像生成或文件分析等指令委派給其他 Gemini 模型處理。
並針對複雜環境,模型在噪音干擾下仍可精準辨識英數混雜的訂單編號,並支援自訂詞彙表以適配產業術語,涵蓋逾 85 種語言與方言口音,在預錄音訊中亦可精準標記最多三位發話者。
Google 正加速將該模型導入旗下各項產品:Android 版 Gboard 的「Rambler」功能已藉此實現口述自動整理,Antigravity 能結合螢幕上下文提升轉寫精準度,Chrome 的即時語音輸入功能也即將上線。
在開發者端,Google 提供雙向低於一秒延遲的即時流式 API(gemini-3.5-transcribe-live),以及具備詞級時間戳記的錄音轉寫 API(Interactions API),兩者目前皆已於 Google AI Studio 與 Gemini 企業平台開放公開預覽。
消息來源 : 1 |