IT之家 7 月 21 日消息,小鵬集團(tuán)(XPEV)今日發(fā)布 TuringViT 高效視覺編碼器,面向 VLM / VLA 時(shí)代系統(tǒng)性重構(gòu)視覺編碼器的架構(gòu)設(shè)計(jì)、數(shù)據(jù)范式與訓(xùn)練流程。
小鵬集團(tuán)(XPEV)表示,TuringViT 將全面支撐智能駕駛、智能座艙(886059)、IRON 人形機(jī)器人(886069)三大業(yè)務(wù)場景,同時(shí)為行業(yè)提供了一條可復(fù)現(xiàn)、低成本訓(xùn)練 SOTA 級(State-of-the-Art,最新技術(shù)水平)視覺 Transformer 的技術(shù)路徑,推動先進(jìn)視覺大模型從“頭部團(tuán)隊(duì)專屬”走向“行業(yè)普惠”。
▲ TuringViT 的塊架構(gòu)和模型配置
據(jù)介紹,TuringViT 從架構(gòu)、數(shù)據(jù)、訓(xùn)練三個(gè)維度同步突破,打造了“線性注意力主導(dǎo) + 高質(zhì)量數(shù)據(jù)治理 + 原生動態(tài)分辨率”的完整技術(shù)體系,實(shí)現(xiàn)了效果、效率與落地性的三重提升。
TuringViT 共推出兩個(gè)規(guī)格版本:
TuringViT-18L 包含 3 組 Turing Block(XYZ)(共 15 層 TLA+3 層 MHA),主打動態(tài)分辨率下的高效部署;
TuringViT-24L 包含 4 組 Turing Block(XYZ)(共 20 層 TLA+4 層 MHA),在保持線性計(jì)算主導(dǎo)的前提下進(jìn)一步提升表征能力。
實(shí)測數(shù)據(jù)顯示,隨著輸入分辨率提升,TuringViT 的延遲增長曲線遠(yuǎn)平緩于標(biāo)準(zhǔn) softmax ViT,高分辨率下的效率優(yōu)勢愈發(fā)顯著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量達(dá)到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,為高分辨率感知、多攝像頭輸入、長時(shí)序視頻處理的端側(cè)部署掃清了核心障礙。
不同于行業(yè)“堆數(shù)據(jù)規(guī)?!钡拇址怕肪€,TuringViT 打造了 VISTA-Curation 多模態(tài)數(shù)據(jù)治理流水線,通過提升單樣本的監(jiān)督價(jià)值實(shí)現(xiàn)數(shù)據(jù)效率的量級提升,從“用更多數(shù)據(jù)”轉(zhuǎn)向“用更優(yōu)質(zhì)的監(jiān)督”。
針對圖文數(shù)據(jù),流水線通過三步精細(xì)化篩選實(shí)現(xiàn)質(zhì)量升級:
第一步過濾低分辨率、模糊、低紋理的低質(zhì)量圖片;
第二步通過多模型、多提示詞生成多樣化候選字幕,并交叉驗(yàn)證視覺一致性;
第三步在統(tǒng)一對比池中通過相對圖文對齊度、文本信息量、歧義度綜合打分,篩選出視覺貼合度高、語義信息密度高的優(yōu)質(zhì)標(biāo)注,淘汰模糊、泛化、弱對齊的樣本。
▲ 圖像-文本篩選及處理流程
針對視頻數(shù)據(jù),流水線同樣進(jìn)行全流程治理:先將長視頻切分為連續(xù)短片段并均勻采樣代表幀;再通過語義一致性與運(yùn)動一致性雙重過濾,保留語義連貫、變化信息有效的片段;最后融合局部幀級細(xì)節(jié)字幕與全局時(shí)序語義字幕,生成具備變換感知能力的視頻標(biāo)注,讓模型從連續(xù)畫面中學(xué)習(xí)更魯棒的視覺表征。
▲ 視頻-語義篩選及處理流程
最終,TuringViT 僅用 0.85B 圖文對(約為 SigLIP2-L 訓(xùn)練數(shù)據(jù)規(guī)模的 10%),便在 ImageNet-1K 等六項(xiàng)零樣本分類基準(zhǔn)上取得 83.6% 的平均準(zhǔn)確率,超越使用 10B 數(shù)據(jù)訓(xùn)練的主流開源基線;在 COCO、Flickr30K 圖文檢索任務(wù)上同樣優(yōu)勢顯著,真正實(shí)現(xiàn)了“十分之一數(shù)據(jù),更優(yōu)效果”的突破。
TuringViT 還采用四階段漸進(jìn)式原生動態(tài)分辨率訓(xùn)練范式,從預(yù)訓(xùn)練之初就適配下游 VLM / VLA 的輸入特性,告別“固定分辨率預(yù)訓(xùn)練 + 事后適配”的傳統(tǒng)模式。
在智能駕駛領(lǐng)域,TuringViT 是第二代 VLA 模型的核心視覺編碼器,負(fù)責(zé)處理多路環(huán)視攝像頭的高分辨率、多幀動態(tài)道路場景輸入,為預(yù)測式世界模型提供視覺 token。
面向智能座艙(886059)與駕泊一體化場景,TuringViT 的 VLM 原生特性讓視覺特征與語言模型實(shí)現(xiàn)更高效的對齊,可以提供更高的識別精度、不同畫幅和比例的視覺輸入,以支撐更多未來的車輛與用戶交互的豐富座艙功能。
在小鵬 IRON 人形機(jī)器人(886069)的技術(shù)體系中,TuringViT 充當(dāng)著“視覺視網(wǎng)膜”的核心角色,為具身智能提供物體細(xì)粒度識別、空間關(guān)系理解、可操作區(qū)域檢測、動態(tài)環(huán)境追蹤等基礎(chǔ)感知能力。
