鳳凰網(wǎng)科技訊 7月20日,阿里千問今日發(fā)布語(yǔ)音合成大模型Qwen-Audio-3.0-TTS,包含面向?qū)崟r(shí)交互的Flash版本(首包延時(shí)300ms級(jí)別)和面向高質(zhì)量生成的Plus版本。官方表示,新模型在細(xì)粒度標(biāo)簽控制、指令遵循、多語(yǔ)種覆蓋及聲學(xué)魯棒性等方面實(shí)現(xiàn)系統(tǒng)性提升。
在全球第三方權(quán)威榜單Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus斬獲冠軍,Elo評(píng)分達(dá)1237。該模型支持在文本中嵌入[gasp]、[giggles]等結(jié)構(gòu)化標(biāo)簽,對(duì)語(yǔ)氣、情緒和呼吸細(xì)節(jié)進(jìn)行精準(zhǔn)調(diào)控。音頻輸出從24KHz提升至48KHz,單次語(yǔ)音合成可達(dá)3分鐘。
模型覆蓋中、英、日、韓、德等16種語(yǔ)言,并支持廣東、重慶、東北、上海、四川、云南等20種方言。配套音色庫(kù)將陸續(xù)上架指令風(fēng)格、方言及多語(yǔ)種音色。
