8月17日消息,阿里千问 AI 平台上线 Qwen-Audio-3.0 系列语音模型,产品线覆盖语音识别、实时语音对话和语音合成等方向。根据千问 AI 平台发布记录,目前已提供 Qwen-Audio-3.0-ASR-Flash、Qwen-Audio-3.0-Realtime 以及 Qwen-Audio-3.0-TTS 等系列模型。

其中,Qwen-Audio-3.0-ASR-Flash 系列包括实时识别和非实时文件转写版本。官方文档显示,该系列支持普通话及粤语、吴语、闽南语、客家话、赣语、湘语等中文方言,同时覆盖多种地区口音和多语种识别;模型还支持热词与 Prompt 上下文,用于提升特定词汇的识别效果。非实时文件转写版本支持说话人分离,适合会议、访谈和录音整理等场景。
实时语音对话方面,Qwen-Audio-3.0-Realtime 提供 Plus 和 Flash 两个版本。该模型通过流式音频输入以及流式语音、文本输出实现端到端语音交互,支持 WebSocket、AOQ 和 WebRTC 等接入方式,并提供声学 VAD、智能语义轮次和手动控制三种交互模式。官方文档还列出了 Function Calling、对话上下文管理、声音复刻音色和说话人增强等能力。
语音合成方面,Qwen-Audio-3.0-TTS 分为面向高品质专业场景的 Plus 版本和面向低延迟实时交互的 Flash 版本。千问 AI 平台称,该系列增加了小语种和中文方言支持,并增强了指令遵循与细粒度标签控制能力。随着识别、理解、合成和实时交互能力被集中到同一平台,开发者可以根据实时字幕、录音转写、语音助手、智能客服或内容制作等需求选择对应模型。