鳳凰網(wǎng)科技訊 7月21日,小鵬集團(XPEV)正式發(fā)布TuringViT高效視覺編碼器,面向VLM/VLA時代系統(tǒng)性重構(gòu)了視覺編碼器的架構(gòu)設(shè)計、數(shù)據(jù)范式與訓(xùn)練流程。該編碼器將全面支撐小鵬智能駕駛、智能座艙(886059)及IRON人形機器人(886069)三大業(yè)務(wù)場景。
TuringViT的核心技術(shù)創(chuàng)新包括三個方面:
Turing線性注意力架構(gòu):采用“5層線性注意力+1層標準多頭注意力”的混合Turing Block(XYZ)架構(gòu),將計算復(fù)雜度從二次方降至近線性。實測顯示,在1536×1536分辨率下,TuringViT-18L推理吞吐量達到Seed1.5-ViT的3.04倍,為高分辨率感知、多攝像頭輸入的端側(cè)部署掃清了算力障礙。
VISTA-Curation數(shù)據(jù)治理:通過三步精細化篩選(質(zhì)量過濾、多樣化字幕生成與交叉驗證、綜合評分排序),僅用0.85B圖文對(約SigLIP2-L訓(xùn)練數(shù)據(jù)的10%),便在ImageNet-1K等零樣本分類基準上取得83.6%平均準確率,超越使用10B數(shù)據(jù)訓(xùn)練的主流開源基線。
原生動態(tài)分辨率訓(xùn)練:采用四階段漸進式訓(xùn)練范式(視覺初始化→范圍受限動態(tài)分辨率→原生分辨率精調(diào)→圖文視頻混合訓(xùn)練),從預(yù)訓(xùn)練階段就適配下游VLM/VLA的輸入特性,無需事后適配。
小鵬表示,TuringViT的價值在于為行業(yè)提供了一條可復(fù)現(xiàn)、低成本訓(xùn)練SOTA級視覺Transformer的技術(shù)路徑,推動先進視覺大模型從“頭部團隊專屬”走向“行業(yè)普惠”。相關(guān)論文及代碼已同步公開。
