IT之家 7 月 15 日消息,阿里巴巴(BABA)實時語音交互對話模型 Qwen-Audio-3.0-Realtime 今天(15 日)正式發(fā)布,在智商、Agent 工具調(diào)用、共情對話和雙工交互流暢度四條主線上同步升級,力求“又快又聰明”。
模型包括推理更強的 Plus 版本和速度更快的 Flash 版本,適用于智能客服、教育培訓、娛樂互動與情感陪伴等場景。官方表示,該模型將讓語音交互“懂傾聽,更聰明”。
針對自定義音色需求,也提供了音色克隆能力配置用于實際業(yè)務(wù)應(yīng)用。在 S2S 語音指令遵循公開 Benchmark(BHE) VStyle 上取得 SOTA 效果。
官方公布了該模型的一系列亮點如下:
根據(jù)語境動態(tài)調(diào)整語氣與情感表達,支持音色克隆,告別機械朗讀感;
內(nèi)置多模態(tài)雙工控制模型,支持聲紋級背景過濾,嘈雜環(huán)境下對話依然流暢,不易被打斷;
Artificial Analysis 子項中綜合排名第一,超越 OpenAI GPT-Realtime-2。
支持動態(tài)工具調(diào)用,可完成路線規(guī)劃、信息查詢等任務(wù),不止是聊天。
模型能夠根據(jù)對話語境動態(tài)調(diào)整語氣、節(jié)奏、音調(diào)和情感表達,實現(xiàn)真正擬人化的語音交互。
在激烈的辯論場景中,準確理解對方論點、快速組織反駁邏輯,同時保持口語化表達和適當?shù)恼Z氣強度。
角色扮演時,能根據(jù)設(shè)定的角色(如歷史人物、職業(yè)身份等)調(diào)整說話風格、用詞習慣和情感表達,并響應(yīng)顯式指令進行風格切換。
在情感陪伴中,當你傾訴煩惱或分享喜悅時,通過語調(diào)、節(jié)奏和內(nèi)容表達共情,提供溫暖的情感支持。
該模型實現(xiàn)生成側(cè)的深度優(yōu)化。
情感感知生成:識別你的情緒狀態(tài),并給予有溫度的共情回應(yīng)。
韻律動態(tài)調(diào)整:根據(jù)語義重點與對話節(jié)奏,自動調(diào)整語速、停頓、重音等韻律特征。
副語言信息處理:能夠理解和生成笑聲、嘆息、猶豫等非語言聲音信號,還原真人交流的細膩。
個性化風格適配:一秒切換專屬說話風格,完美演繹你設(shè)定的任何角色。
無論身處何種復雜聲場,它都能保持從容:
嘈雜背景環(huán)境下的雙工對話:在餐廳、開放工區(qū)等嘈雜環(huán)境中,不受干擾,精準鎖定你的聲音。
多人交談不打斷:在多人討論中,準確識別主對話對象,不被旁聽者干擾。
多說話人智能切換:根據(jù)上下文和語義線索,智能判斷當前對話對象,在不同說話人間自然切換。
