新浪科技訊 9月22日上午消息,阿里巴巴在雲棲大會上宣佈語音模型家族Qwen-Audio-3.1全新升級,包含語音轉寫(ASR)、語音合成(TTS)和實時語音交互(Realtime)三大系列。
基於下代架構的音頻理解模型Qwen-Audio-3.1-ASR-Next全新發布,它能夠理解人物情緒、音樂、環境聲與機械聲,完成聲音描述、事件定位、音頻問答與推理,讓「這段錄音中人的情緒怎樣」這樣的問題能夠被理解和準確回答。
同時,音頻創作模型Qwen-Audio-3.1-TTS-Next全新亮相,它採用全新架構,可根據一段腳本,直接生成融合對白和環境聲的完整音頻,極大提高有聲書、影視劇和播客等專業創作的效率。
Qwen-Audio-3.1-Realtime實時交互能力再提升,能夠邊聽、邊想、邊說,並進一步增強多語言交互、角色扮演和共情能力。目前,該系列模型已應用於千問辦公和Qoder,並接入QwenNote A2隨身助理、QwenNote Eva桌面機器人和千問AI眼鏡等硬件產品。
此外,同聲傳譯模型Qwen3.8-LiveTranslate首次現身,人類同傳平均時延在4秒以上,但該模型可將時延壓縮至不到2.5秒。據了解,新模型已接入千問AI眼鏡、QwenNote A2、釘釘耳機等AI硬件。
阿里大模型加速走向終端。AI手機全棧解決方案Qwen Intelligence也將於大會期間發布,專為手機場景深度優化,為合作伙伴提供基於千問大模型的 Agent 技術平台,讓手機能夠更可靠地完成跨應用的複雜任務。