IT之家 7 月 20 日消息,阿里千問今日發(fā)布語音合成大模型 Qwen-Audio-3.0-TTS,包含面向?qū)崟r交互的 Flash 版本(首包延時 300ms 級別)和面向高質(zhì)量生成的 Plus 版本。
官方表示,新模型在細粒度標簽控制、freestyle 指令遵循、多語種與方言覆蓋以及復(fù)雜聲學魯棒性等方面實現(xiàn)系統(tǒng)性提升,讓合成語音從“能說話”走向“會表達”。在全球第三方權(quán)威榜單 Artificial Analysis,Qwen-Audio-3.0-TTS-Plus 斬獲冠軍。
據(jù)介紹,Qwen-Audio-3.0-TTS 支持在文本中嵌入結(jié)構(gòu)化標簽,用戶可直接在文本里嵌入 [gasp](抽氣)、[giggles](輕笑)、[angry](憤怒)這類標記,直接對語氣、情緒和 breath 類細節(jié)進行精準調(diào)控。
此外,該模型配套開箱即用的精品音色庫,將模型在多語種、多方言、指令控制和細粒度表達上的能力沉淀為可直接調(diào)用的音色資源,將陸續(xù)上架指令風格音色、20 種方言音色、細粒度控制音色以及 14+ 小語種音色。并將音頻輸出從提升 24KHz 到 48KHz,相當于從電話和普通語音助手的品質(zhì)提升到錄音棚、影視配音的規(guī)格,單次語音合成可達 3 分鐘。
面向全球多語種場景,Qwen-Audio-3.0-TTS-Plus 進行了專項優(yōu)化,覆蓋中、英、日、韓、德等 16 種語言,新增阿拉伯、越南、馬來、菲律賓語;并支持廣東、重慶、東北、陜西、上海、四川、云南等 20 種方言。
