Qwen-Audio-3.1 – 阿里通义推出的语音大模型系列
Qwen-Audio-3.1是什么
Qwen-Audio-3.1 是通义千问推出的语音大模型系列,包含五款模型:ASR 语音识别、ASR-Next 音频理解、TTS 语音合成、TTS-Next 音频创作、Realtime 实时交互,覆盖理解-生成-交互-创作全链条。Qwen-Audio-3.1支持 30 种语言和 16 种方言,分角色转写,情绪感知与全双工实时对话,可调用工具完成任务。

Qwen-Audio-3.1的主要功能
-
ASR 语音识别:支持 30 种语言和 16 种中文方言的分角色转写,带说话人标签和时间戳,可原生润色文本。
-
ASR-Next 音频理解:从转写文字扩展到理解人物情绪、环境声与机械声,支持声音描述、事件定位和音频问答。
-
TTS 语音合成:支持多语种、多方言合成,同一音色跨语言自然迁移,可指令控制情绪与语速。
-
TTS-Next 音频创作:一次生成人声、音效与环境音构成的完整音频,适用于播客、有声书、影视、游戏、广告。
-
Realtime 实时交互:全双工同时听说,理解情绪与意图,多语言切换,并能在对话中调用工具完成任务。
Qwen-Audio-3.1的技术原理
- 端到端联合建模(ASR):Qwen-Audio-3.1-ASR 采用端到端方案,将说话人标签、时间戳和转写文本联合输出,而非传统级联系统的分步处理,因此能保留短插话和重叠语音;模型同时内置去语气词、去重复、自我纠正和语义重组能力,使转写结果在结构上可直接用于会议记录和对话分析。
- 下一代音频理解架构(ASR-Next):ASR-Next 基于下一代架构,将处理对象从”语音中的文字”扩展为完整音频信号,通过理解声学层面的情绪、环境声与机械声,完成声音事件定位、描述与推理,标志着 ASR 从转写工具升级为泛音频理解模型。
- 音色迁移与表达控制(TTS):TTS 模型突破只追求字音正确的传统合成方式,在同一音色上实现跨语言、跨方言的自然迁移,并通过指令对情绪、语速和表达方式建模,让合成语音贴合内容与场景。
- 统一音频生成(TTS-Next):TTS-Next 围绕文本、时间戳和参考音频三类输入,统一生成人声、音效和环境音;在多轮对话中保持各角色音色与情绪一致,并通过自然语言控制生成过程,支持细粒度时间戳控制、声音复刻和 48kHz 高保真输出。
- 多教师蒸馏的全双工架构(Realtime):Realtime 采用多教师蒸馏架构,在保持低延迟的同时提升理解、推理、表达与安全能力,实现全双工交互,说与听同时发生,支持随时插话打断;模型整合工具调用能力,能在持续对话中理解变化的需求,连接外部 API、知识库和业务系统完成任务。
如何使用Qwen-Audio-3.1
-
打开千问 AI 平台:访问 https://www.qianwenai.com/并登录账号,进入模型广场。
-
选择所需模型:根据需求选择对应模型,ASR(转写)、TTS(合成)、TTS-Next(创作)、Realtime(实时交互),点击进入详情页。
-
获取 API Key:在控制台开通模型服务并创建 API Key,用于接口鉴权。
-
调用接口:参考各模型详情页的 API 文档,通过 HTTP 请求传入音频或文本参数(ASR-Next API 尚未上线,需等待开放)。
-
集成到应用:将接口接入自己的应用、Agent 或智能硬件,语音任务即可在线完成。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
粤公网安备 123456789号