互联网

阿里通义千问发布语音合成大模型 Qwen-Audio-3.0-TTS,登 Artificial Analysis 榜首

来源: IT之家    作者: IT之家      2026年07月22日 14:36

导语:7月20日,阿里通义千问发布语音合成大模型 Qwen-Audio-3.0-TTS,包含面向实时交互的 Flash 版本与面向高质量生成的 Plus 版本。

摘要:
7月20日,阿里通义千问发布语音合成大模型 Qwen-Audio-3.0-TTS,包含面向实时交互的 Flash 版本与面向高质量生成的 Plus 版本。据官方介绍,新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学环境鲁棒性等方面实现系统性提升。语言上覆盖中文、英文、日语、韩语、德语等 16 种语言,并支持广东、重庆、东北、陕西、上海、四川、云南等 20 种方言。音质方面,音频输出采样率从 24KHz 提升至 48KHz,单次语音合成最长可达 3 分钟;Flash 版本首包延时为 300ms 级别。在第三方权威榜单 Artificial Analysis 上,Qwen-Audio-3.0-TTS-Plus 位列冠军。

正文:

IT之家 7 月 20 日消息,阿里千问今日发布语音合成大模型 Qwen-Audio-3.0-TTS,包含面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本。

官方表示,新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。在全球第三方权威榜单 Artificial Analysis,Qwen-Audio-3.0-TTS-Plus 斩获冠军。

1.png

据介绍,Qwen-Audio-3.0-TTS 支持在文本中嵌入结构化标签,用户可直接在文本里嵌入 [gasp](抽气)、[giggles](轻笑)、[angry](愤怒)这类标记,直接对语气、情绪和 breath 类细节进行精准调控。

此外,该模型配套开箱即用的精品音色库,将模型在多语种、多方言、指令控制和细粒度表达上的能力沉淀为可直接调用的音色资源,将陆续上架指令风格音色、20 种方言音色、细粒度控制音色以及 14+ 小语种音色。并将音频输出从提升 24KHz 到 48KHz,相当于从电话和普通语音助手的品质提升到录音棚、影视配音的规格,单次语音合成可达 3 分钟。

面向全球多语种场景,Qwen-Audio-3.0-TTS-Plus 进行了专项优化,覆盖中、英、日、韩、德等 16 种语言,新增阿拉伯、越南、马来、菲律宾语;并支持广东、重庆、东北、陕西、上海、四川、云南等 20 种方言。

2.jpg

Qwen-Audio-3.0-TTS 现已全面开放,附链接:

(文章为作者独立观点,不代表艾瑞网立场)
  • 合作伙伴

  • 官方微信
    官方微信

    新浪微博
    邮件订阅
    第一时间获取最新行业数据、研究成果、产业报告、活动峰会等信息。
     关于艾瑞| 业务体系| 加入艾瑞| 服务声明| 信息反馈| 联系我们| 合作伙伴| 友情链接

Copyright© 沪公网安备 31010402000581号沪ICP备15021772号-10

扫一扫,或长按识别二维码

关注艾瑞网官方微信公众号