据悉,阿里巴巴发布了语音合成大模型Qwen-Audio-3.0-TTS。该模型在细粒度标签控制、指令遵循、多语种方言覆盖及声学鲁棒性方面均有提升,包含面向实时交互的Flash版本和面向高质量生成的Plus版本。目前,Plus版本已在全球权威榜单中斩获冠军。
新模型在细粒度控制上实现跃迁,用户可通过在文本中嵌入结构化标签来精确控制发音细节,适用于叙事、游戏等场景。它覆盖了16种语言和20种方言,并通过方言强化训练确保发音地道。
该模型增强了在嘈杂环境下的语音克隆能力,并提升了音频输出质量至48kHz,单次合成可长达3分钟。目前,两款模型已在阿里云百炼平台开放调用。


粤公网安备 44010602000162号
网友评论