姨母的诱惑电影,交换同学会,brandilove新版,新町点烟盘,韩国大全,隐形的亿万富翁电影版,《二十不惑2》电视剧

阿里通義實驗室發(fā)布 Wan-Streamer v0.2 模型,AI 視頻電話響應延遲僅 550ms

2026-07-17 16:14:51
來源:IT之家
分享
文章提及標的

IT之家 7 月 17 日消息,今日,阿里通義實驗室發(fā)布 Wan-Streamer v0.2 模型,讓 AI 像真人一樣邊聽、邊看、邊回應。

IT之家從官方介紹獲悉,它是面向?qū)崟r雙工交互的端到端全模態(tài)理解與生成模型,把“聽、看、說、演”統(tǒng)一進單個 Transformer 中。

極致低延遲:端到端響應延遲 550ms(200ms 模型延遲 + 350ms 網(wǎng)絡延遲),

畫質(zhì)增強:輸出分辨率從 v0.1 的 192×336 提升至 640×368 @ 25FPS,微表情場景細節(jié)清晰可見;

全模態(tài)端到端:原生支持文本、音頻、視頻的實時理解與同步生成,無需外部模塊拼裝。

該團隊對比了市面上主流的實時交互系統(tǒng)。在響應延遲上,Wan-Streamer 的端到端交互延遲在 0.55s 左右(含網(wǎng)絡傳輸),顯著快于常見的實時語音對話模型。

在功能覆蓋上,Wan-Streamer 同時具備了視頻感知、視頻輸出、全雙工交互、端到端架構且響應延遲控制在 1 秒內(nèi)。

Wan-Streamer 將用戶的文本、音頻、視頻輸入,與智能體的輸出,統(tǒng)一映射到同一條因果時間線(Causal Timeline)上。

模型無需等待“一整段話”說完,而是引入了流式單元(Streaming Unit)的概念。大約每 160ms 就會完成一次完整的閉環(huán):

感知當前 160ms 的用戶音視頻輸入;

更新共享的交互狀態(tài)與上下文;

生成同步的語音和視頻 Latent(潛變量);

解碼并輸出上一單元的音視頻響應。

這意味著,AI 不需要等你說完再想,而是在你說話的每一小段時間里,同步完成“感知 → 理解 → 生成 → 解碼”。這種原生流式的建模方式,是實現(xiàn)極低延遲與全雙工交互的基礎。

v0.1 驗證了端到端原生流式音視頻對話的可行性,但 192×336 的分辨率在視覺上局限于近景特寫(Close-up),主要聚焦于面部和嘴型。

v0.2 將輸出分辨率大幅提升至 640×368。這不僅僅是像素的增加,更帶來了視覺構圖與應用場景的質(zhì)變。

AI 不再只是一個“懸浮的頭部”。在 v0.2 的畫面中,你可以清晰看到它的視線方向、身體姿態(tài)、自然的手勢動作,甚至它面前的桌子和周圍的房間布局。

分辨率的大幅提升,意味著視頻 Latent 生成的計算量顯著增加。如果將這些計算任務放在原有的低延遲通路中,200ms 的模型側(cè)延遲底線將被突破。如何在提升畫質(zhì)的同時,不增加用戶可感知的延遲?Wan-Streamer v0.2 將模型拆分為兩條并行通路,在物理硬件上進行解耦:

思考者:單卡快車道

Thinker 部署在單張 GPU 上,負責所有對延遲敏感的任務:流式音視頻感知、語言與狀態(tài)更新、構建 K/V 緩存(讓模型記住上下文),以及音頻解碼。

它就像對話中的“大腦”,負責快速聽懂你的話、記住上下文,并立刻組織語言,保證 200ms 的極低響應。

執(zhí)行者:多卡 Ulysses 并行

640×368 的高分辨率視頻生成計算量極大。在 Wan-Streamer v0.2 中,Performer 被擴展為一個多 GPU 的 Ulysses 式上下文并行集群,專門承擔這部分重載計算。

它就像幕后的“渲染團隊”。因為高清畫面計算量大,系統(tǒng)采用 Ulysses 序列并行機制,將長視頻序列切分給多張顯卡分工合作、并行去噪。(注:由于音頻 Latent 序列較短,切分反而會增加通信開銷,因此音頻生成不進行序列切分,直接計算)。

時序重疊

更關鍵的設計在于時序調(diào)度。單卡 Thinker 的工作窗口與多卡 Performer 的計算窗口是重疊的。當 Performer 集群在后臺處理當前幀的高清視頻 Latent 時,Thinker 已經(jīng)在處理下一幀的用戶輸入,并解碼上一幀的音頻。

通過這種“快慢分工、時序重疊”的架構,v0.2 將額外的視覺生成成本從延遲敏感路徑中剝離。在包含 350ms 雙向網(wǎng)絡預算的情況下,總遠程交互延遲依然保持在約 550ms。

▲ Wan-Streamer v0.2 延遲保持部署拓撲時序圖

只要能用自然語言描述,Wan-Streamer 就能在虛擬世界里把那個 " 角色 " 實時呈現(xiàn)出來,和你面對面交流。沒有預設劇本,沒有固定角色庫 —— 你的想象力就是唯一的邊界。

你可以和秦始皇聊統(tǒng)一六國,聽李白即興吟詩、讓蒙娜麗莎開口說話,和清明上河圖里的路人聊聊宋朝生活,還能問問你家貓主子整天都在想什么......

基于這種高度自由的角色生成能力,Wan-Streamer 典型的應用場景包括:

視頻通話式 AI 助手:打開攝像頭即可面對面交流,適用于口語陪練、面試模擬、心理咨詢等需要“在場感”的場景。

場景化陪伴與教育:AI 老師可以通過畫面“看著”學生的表情判斷理解程度;AI 可以在廚房里實時指導做菜的步驟。

沉浸式游戲(881275) NPC:游戲(881275)中的角色可以擁有表情、肢體語言和實時反應,與玩家進行真正的“面對面”對話。

無障礙交互:為聽障用戶實時生成帶精確唇語和手勢的視頻回應;為視障用戶實時描述攝像頭捕捉到的周圍環(huán)境。

讓 AI 能夠自然地參與實時對話,需要它真正理解用戶的話語、讀懂表情,并在幾百毫秒內(nèi)給出綜合反應。

Wan-Streamer v0.2 是我們在這一方向上的持續(xù)探索:通過原生流式架構與分布式推理拓撲,在單一模型的交互循環(huán)中同時完成理解與生成,讓 AI 的溝通方式進一步逼近真人。

這是一條長期的研究路線,我們將持續(xù)迭代 Wan-Streamer,敬請期待。

 ?

免責聲明:風險提示:本文內(nèi)容僅供參考,不代表同花順觀點。同花順各類信息服務基于人工智能算法,如有出入請以證監(jiān)會指定上市公司信息披露平臺為準。如有投資者據(jù)此操作,風險自擔,同花順對此不承擔任何責任。
homeBack返回首頁
不良信息舉報與個人信息保護咨詢專線:10100571違法和不良信息涉企侵權舉報涉算法推薦舉報專區(qū)涉青少年不良信息舉報專區(qū)

浙江同花順互聯(lián)信息技術有限公司版權所有

網(wǎng)站備案號:浙ICP備18032105號
證券投資咨詢服務提供:浙江同花順云軟件有限公司 (中國證監(jiān)會核發(fā)證書編號:ZX0050)
AIME