模型發布 | 谷歌發布Gemini 3.8 Live雙模型,強化實時語音AI

老虎資訊綜合
12小時前

谷歌周二推出兩款新模型Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,重點提升語音對話中的推理能力。

谷歌表示,Gemini 3.8 Live主要面向需要大規模使用的場景,在對話能力、響應速度和視覺理解方面進行了優化。Extended Thinking版本則針對更復雜的任務,可以進行多步驟推理。

兩款模型都支持實時處理視覺信息。Gemini 3.8 Live支持97種語言,並可以在對話過程中自動切換語言。用戶提出請求後,模型還可以在後台調用工具和API,同時繼續與用戶交流,不必等任務完成後再繼續對話。

對於需要更多計算的任務,Gemini 3.8 Live Extended Thinking可以一邊進行推理,一邊與用戶交流。谷歌表示,模型在執行較複雜的後台任務時,會通過語音告知用戶當前進展。

在Artificial Analysis的Speech to Speech Quality Index測試中,Gemini 3.8 Live Extended Thinking得分82.6分,排名第一;該模型在Big Bench Audio測試中的得分為97.7%。Gemini 3.8 Live在Speech Agent Arena中排名第二。

在功能方面,Gemini 3.8 Live可以近實時處理視覺輸入,為語音交流提供更多上下文。該模型支持97種語言,並能夠在對話過程中自動切換語言。

新模型還可以在後台執行工具和API調用,同時繼續與用戶對話。例如,用戶提出請求後,模型可以先進行回應,在後台完成任務,而不必讓用戶等待整個過程結束。

對於需要更復雜推理的任務,Gemini 3.8 Live Extended Thinking可以在思考的同時繼續進行語音交流。谷歌表示,該模型能夠通過「讓我查一下」等語音提示回應用戶,並在執行多步驟後台任務時實時播報進展。

谷歌表示,兩款模型已開始陸續開放。開發者可以通過Gemini API和Google AI Studio使用,企業客戶可以在Gemini Enterprise中進行預覽。此外,Gemini 3.8 Live已開始在Google Search Live中推出,Extended Thinking版本也開始向Gemini Live用戶開放。

谷歌還表示,其AI產品生成的音頻均加入SynthID水印,以便識別AI生成內容。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10