阿里发布语音合成大模型Qwen-Audio-3.0-TTS:Flash首包300ms级别,Plus登顶全球榜单
7月20日晚间消息,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获冠军。

Qwen-Audio-3.0-TTS的上一代版本已支持freestyle(自由风格模式),可在提示词中加入“资深客服”、“足球解说员”等角色设定,以控制情绪、场景和语速等。新模型则在细粒度上进一步跃迁,通过结构化标签,用户可直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记,把控制精度从整段情绪细化到“哪个字后面该倒吸一口气”,适用于需要精确控制细节的叙事、游戏、配音等场景。
面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖中、英、日、韩、德等16 种语言,新增阿拉伯语、越南语、马来语以及菲律宾语。
模型规模越大、训练数据越杂,方言的发音会不自觉地滑向普通话腔。针对这个痛点,研究团队专门设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等 20种方言。
语音克隆产品往往要求原始参考音频在安静环境下录制,Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,让模型在高噪声、高混响条件下也能过滤干扰、只留音色。面向严肃创作场景,模型拥有开箱即用的精品音色库,并将音频输出从提升24kHz 到 48kHz,相当于视频配音和有声书的品质提升到录音棚、影视配音的规格,单次语音合成可长达 3 分钟。
即日起,两款模型已在阿里云百炼开放调用。
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
万站齐发、上行峰值 1Gbps!揭秘全球最大5G-A百兆大上行网络
人工智能技术的发展正在迅速改变现代社会的运行模式,越来越多的人开始习惯于使用自己的AI助手,接入网络的AI终端、机器人、无人机、工业设备也越来越多。为适应这些新的需求趋势,移动网络..[详细]
专题报道丨2026世界人工智能大会暨人工智能全球治理高级别会议
7月17日,2026世界人工智能大会暨人工智能全球治理高级别会议在上海启幕。本届大会在展览规模、首发新品数量等方面均创下新高——展览总面积首次突破10万平方米,1100余家企业参展,3000余项..[详细]
需求导向、服务产业:一文读懂中国工业互联网高质量发展之路
工业互联网是传统工业、制造业数智化升级的技术底座,同时也是实体经济与数字经济深度融合的关键底座,是推进新型工业化发展的重要基础设施。近年来,在产业链各方的协同努力下,中国工业互..[详细]
6G时代运营商有望新增的两款套餐:个性化信号、低时延AI算力
假如运营商在6G时代能够保障用户在通勤途中,一场重要的在线视频会议能够顺畅连接不中断,是否会有人愿意为此而加购套餐呢?在6G时代,随着网络不仅仅只有连接能力,还引入了感知与计算,运..[详细]
从算力到智力:数据如何重塑AI时代
当算力竞赛的硝烟渐渐散去,真正的战场已悄然转向数据。尽管企业间对算力的追逐一刻也没有停歇,在2026年的今天,业界关心的,已不再仅仅是某个数据中心集成了多少算卡、算力有多强,而是开..[详细]
对话西古光通司正中:40年破局重生路,擘画高质量发展新蓝图
7月10日,西安高新技术产业开发区。在西安西古光通信有限公司成立40周年之际,西古光通总经理司正中接受了飞象网的专访。在轻松的谈话氛围里,司正中谈及公司的过往,并不是任何一家科技企业..[详细]













