Google 發佈了 Gemini Audio 的一系列更新,其中包括全新的 Gemini 3.5 Transcribe 轉錄模型。這項更新旨在提升語音轉文字的精確度,使其能自動偵測超過 85 種語言與專業術語,並能處理背景噪音及說話中斷的情況。

重點文章
全新轉錄模型 Chirp 3 大幅超越
Gemini 3.5 Transcribe 是 Gemini 家族的全新成員,Google 表示它是迄今「最精確的語音轉文字模型」。相較於 2025 年推出的舊有轉錄模型 Chirp 3,新模型在多語言性能與詞語錯誤率方面均有顯著進步。根據 Artificial Analysis 的測量,新模型在串流模式下的平均詞語錯誤率為 4.0%,非串流模式下為 2.6%,而且最終轉錄所需的時間減少了 70%。
支援自訂詞彙與語音編輯
這項功能讓使用者可以透過語音自然地編輯文字。Gemini 3.5 Transcribe 能自動格式化文本,並移除如「嗯」、「呃」等填充語氣詞。使用者還可以向模型提供自訂詞彙表,使其能自動適應獨特的拼寫需求與專業術語,避免後續手動編輯。此外,模型也能在預錄音訊中識別最多三位說話者,並提供逐字時間戳。
同步推出 3.5 Live 即時模型
與 Gemini 3.5 Transcribe 同步推出的,還有 Gemini 3.5 Live 與 3.5 Live Experimental 兩個即時模型。3.5 Live 增強了處理句子中斷、語言識別及即時視覺處理的能力。而 3.5 Live Experimental 更進一步,能在處理複雜任務的同時,即時逐步敘述其推理過程。


首先登陸 macOS 與 Android
這項 Gemini Audio 更新已開始推出,適用於所有 macOS 版 Gemini 應用程式的英文使用者,以及部分國家和語言的 Android 版 Gboard 口述功能。開發者亦可透過 Gemini API 的 AI Studio 與 Antigravity 進行公開預覽。Google 表示,針對 Chrome 瀏覽器的支援即將推出。