近日,阿里云推出自研AOQ(AI Over QUIC)協(xié)議,基于QUIC深度定制,支持全格式統(tǒng)一承載,并實(shí)現(xiàn)“實(shí)時(shí)/非實(shí)時(shí)”雙模自適應(yīng)傳輸,在極端弱網(wǎng)環(huán)境下為多模態(tài)AI提供確定性的低延遲與高可靠體驗(yàn)。
傳統(tǒng)協(xié)議面臨的“不可能三角”
多模態(tài)AI實(shí)時(shí)對(duì)話要求網(wǎng)絡(luò)傳輸同時(shí)具備實(shí)時(shí)性、可靠性和同步性,三者構(gòu)成經(jīng)典協(xié)議難以兼顧的矛盾:
弱網(wǎng)實(shí)時(shí) | 內(nèi)容可靠有序 | 多載體強(qiáng)同步 | 用戶感受 | |
傳統(tǒng)可靠協(xié)議 | “太慢太卡” | |||
傳統(tǒng)實(shí)時(shí)協(xié)議 | “能到,交互形式單一“ | |||
AOQ | “能到,交互豐富” |
AOQ基于QUIC協(xié)議的底層優(yōu)勢(shì),參考傳統(tǒng)實(shí)時(shí)協(xié)議的優(yōu)化手段,針對(duì)AI多模態(tài)數(shù)據(jù)的復(fù)雜特性進(jìn)行了深度定制與重構(gòu),實(shí)現(xiàn)了實(shí)時(shí)、可靠和同步的三者兼得。
實(shí)測(cè)數(shù)據(jù)顯示,AOQ相比WebSocket和WebRTC在多個(gè)關(guān)鍵指標(biāo)上均有顯著提升:
(圖1:實(shí)時(shí)通信協(xié)議體驗(yàn)對(duì)標(biāo)。AOQ 在強(qiáng)弱網(wǎng)建連效率、弱網(wǎng)低延時(shí)、抗卡頓、切網(wǎng)無感與斷網(wǎng)續(xù)播等維度全面領(lǐng)先WebSocket與WebRTC)
AOQ的破局與核心優(yōu)勢(shì)
AOQ協(xié)議針對(duì)AI全雙工交互設(shè)計(jì)了分層架構(gòu),逐層深度優(yōu)化:
(圖2:AOQ 四層架構(gòu))
全格式原生承載
在單條QUIC連接內(nèi)原生支持文本、語音、圖片、文件、實(shí)時(shí)流媒體的并行傳輸。依據(jù)全局時(shí)鐘同步與關(guān)聯(lián)映射機(jī)制,確保多模態(tài)內(nèi)容強(qiáng)制對(duì)齊,避免音畫不同步或圖文錯(cuò)位。全程端到端加密。
多模態(tài)單協(xié)議全交互
“實(shí)時(shí)+非實(shí)時(shí)”雙模自適應(yīng)
針對(duì)大模型輸出“快慢不均”的特性,AOQ實(shí)現(xiàn)了雙模式自適應(yīng):實(shí)時(shí)模式保障音視頻采集數(shù)據(jù)的即時(shí)性和流暢性;非實(shí)時(shí)模式保障文本、圖片等數(shù)據(jù)的完整性,支持超前發(fā)送與端側(cè)緩存——網(wǎng)絡(luò)中斷時(shí)已緩存內(nèi)容仍可續(xù)播。兩種模式根據(jù)網(wǎng)絡(luò)狀況無縫切換。
非實(shí)時(shí)模式超前可靠發(fā)送,斷網(wǎng)依然續(xù)播
雙模式無縫網(wǎng)絡(luò)切換
極致抗弱網(wǎng)能力
0-RTT極速建連,弱網(wǎng)下瞬間建立安全連接。內(nèi)置智能帶寬估計(jì)算法,實(shí)時(shí)感知網(wǎng)絡(luò)波動(dòng)并動(dòng)態(tài)調(diào)節(jié)發(fā)送策略。各模態(tài)數(shù)據(jù)獨(dú)立建流、互不干擾,結(jié)合前向冗余和快速重傳,在60%丟包率下仍能維持流暢對(duì)話。
極速建連響應(yīng)
60%丟包仍能對(duì)話流暢
全球化部署
依托全球節(jié)點(diǎn)和智能調(diào)度,支持就近接入,全鏈路質(zhì)量監(jiān)測(cè)實(shí)現(xiàn)網(wǎng)絡(luò)鏈路動(dòng)態(tài)優(yōu)化。
已落地:百煉Realtime API Realtime API + Qwen-Audio-3.0-Realtime 模型實(shí)現(xiàn)流暢音頻通話
把麥克風(fēng)采集的實(shí)時(shí)流與模型生成的音頻回復(fù)統(tǒng)一承載在一條 AOQ 連接上,實(shí)現(xiàn)雙向低延遲音頻通話。即使畫面與聲音由模型異步生成,也能保持嚴(yán)格同步,弱網(wǎng)下依然流暢。
Realtime API + Qwen-ASR-3.0-Realtime模型實(shí)現(xiàn)語音輸入法
端側(cè)實(shí)時(shí)語音流通過 AOQ 穩(wěn)定上傳,模型邊聽邊轉(zhuǎn)寫,低延遲返回文字結(jié)果。適合需要持續(xù)輸入、對(duì)時(shí)延和可靠性要求高的語音輸入場(chǎng)景。
Realtime API + Qwen 3.5-Livetranslate 實(shí)現(xiàn)實(shí)時(shí)翻譯
源語言語音實(shí)時(shí)上傳,翻譯結(jié)果以文字或語音形式即時(shí)返回。AOQ 的多流同步與弱網(wǎng)抗性,保證翻譯流與原聲流在時(shí)序上對(duì)齊。
歡迎體驗(yàn):
百煉Realtime API已正式對(duì)外發(fā)布,同時(shí)支持 WebSocket、WebRTC 與自研 AOQ 協(xié)議,歡迎前往體驗(yàn)。
API地址: https://help.aliyun.com/zh/model-studio/realtime-api-overview
