商傳媒|何映辰/台北報導
Google 於近日推出兩款新的 AI 模型,Gemini 3.8 Live 和 Gemini 3.5 Transcribe,旨在革新對話式人工智慧(conversational AI)的互動方式。這些模型將讓開發者能夠打造出反應更即時、互動更流暢、甚至能理解視覺情境的語音助理,大幅提升使用者體驗。
Gemini 3.8 Live:即時對話與多模態能力
Gemini 3.8 Live 是 Google 為實現快速語音對話而設計的內建模型。這款模型的一大特色是能在對話進行的同時,在背景執行應用程式介面(API)與工具呼叫(tool calls),並持續音訊回應,確保對話不被中斷。《ExtremeTech》指出,這使得 AI 能夠在處理複雜任務時,仍能維持流暢的互動。The Futurum Group 分析師 Bradley Shimmin 表示,這種架構讓開發者能根據不同需求客製化 AI 的行為模式,實現更自然的對話流程,即便使用者即時中斷或注入新的情境,AI 也能不間斷地處理。
Gemini 3.8 Live 更具備多模態(multimodal)能力,意即它能同時處理多種形式的資料。此模型能以每秒一張的速度分析即時圖像與影片,將使用者的語音與其所見的視覺內容連結起來,讓 AI 能更好地理解對話情境。它支援多達 97 種語言,擁有真實的口音,並能自動在對話中切換語言,讓跨語種溝通更加便利。Gemini 3.8 Live 的音訊對話時長可達 15 分鐘,若同時包含音訊和影像,則最長可持續 2 分鐘。
此外,Google 也推出了 Gemini 3.8 Live 的 Live Extended Thinking 版本,允許使用者配置 AI 模型的內部推理(reasoning)功能。《AI Business》報導,Tekonyx 創辦人 Sid Nag 解釋,這意味著 AI 可以在對話過程中同時進行背景思考,而非停下來等待思考完成再回應,實現了「快速且深思熟慮」的即時互動。這項技術透過分離互動延遲(interactive latency,指使用者動作到系統回應的時間)與推理延遲(指 AI 內部處理資訊的時間),確保 AI 代理在回應快速的同時,也能進行更深入的分析。
Gemini 3.5 Transcribe:高精準語音轉文字
與 Gemini 3.8 Live 同步推出的 Gemini 3.5 Transcribe,則是一款專為語音轉文字設計的模型。它支援 85 種語言,具備自動偵測語種和處理區域口音的能力。Google 表示,該模型的字詞錯誤率(word error rate)在即時串流情境下約為 4%,非串流模式下則降至約 2.6%,顯示其高精準度。開發者可透過兩種 API 介面使用:Live API 支援即時串流語音轉文字,能提供亞秒級延遲的即時字幕;Interactions API 則可用於處理最長一小時的預錄音檔,並提供語者分離(diarization,能識別對話中不同說話者的聲音)及字詞時間戳功能。
開發者取用與防偽機制
開發者可透過 Google AI Studio 和 Gemini API 取用這兩款模型。Google 強調,所有由 Gemini Live 模型生成的 AI 音訊內容都將包含 SynthID 浮水印,這有助於偵測 AI 生成的內容,進而防止假資訊的傳播。此次發布的 Gemini 3.8 Live 和 Live Extended Thinking 已於 9 月 15 日上線,而在此兩週前,Google 也已推出了 Gemini 3.8 Flash 和 Gemini 3.8 Cyber 基礎模型。







