News

Google 發佈 Gemini 3.5 Transcribe 支援 85 種語言並自動移除語氣詞

1 min read
Google 發佈了 Gemini Audio 的一系列更新,其中包括全新的 Gemini 3.5 Transcribe 轉錄模型。這項更新旨在提升語音轉文字的精確度,使其能自動偵測超過 85 種語言與專業術語,並能處理背景噪音及說話中斷的情況。 全新轉錄模型 Chirp 3 大幅超越 Gemini 3.5 Transcribe 是 Gemini 家族的全新成員,Google 表示它是迄今「最精確的語音轉文字模型」。相較於 2025 年推出的舊有轉錄模型 Chirp 3,新模型在多語言性能與詞語錯誤率方面均有顯著進步。根據 Artificial Analysis 的測量,新模型在串流模式下的平均詞語錯誤率為 4.0%,非串流模式下為 2.6%,而且最終轉錄所需的時間減少了 70%。 支援自訂詞彙與語音編輯 這項功能讓使用者可以透過語音自然地編輯文字。Gemini 3.5 Transcribe 能自動格式化文本,並移除如「嗯」、「呃」等填充語氣詞。使用者還可以向模型提供自訂詞彙表,使其能自動適應獨特的拼寫需求與專業術語,避免後續手動編輯。此外,模型也能在預錄音訊中識別最多三位說話者,並提供逐字時間戳。 同步推出 3.5 Live 即時模型 與 Gemini 3.5 Transcribe 同步推出的,還有 Gemini 3.5 Live 與 3.5 Live Experimental 兩個即時模型。3.5 Live 增強了處理句子中斷、語言識別及即時視覺處理的能力。而 3.5 Live Experimental 更進一步,能在處理複雜任務的同時,即時逐步敘述其推理過程。 首先登陸