今年上半年,小鵬集團(tuán)(XPEV)密集發(fā)布物理AI技術(shù)報告,繼多視角生成式世界模型 X-World、世界模型推理加速引擎 X-Cache、預(yù)測式世界模型 X-Foresight 及 X-Mind 技術(shù)框架之后,近日,小鵬正式發(fā)布 TuringViT 高效視覺編碼器,面向 VLM/VLA 時代系統(tǒng)性重構(gòu)視覺編碼器的架構(gòu)設(shè)計、數(shù)據(jù)范式與訓(xùn)練流程。
TuringViT 將全面支撐智能駕駛、智能座艙(886059)、IRON 人形機(jī)器人(886069)三大業(yè)務(wù)場景,同時為行業(yè)提供了一條可復(fù)現(xiàn)、低成本訓(xùn)練 SOTA 級(State-of-the-Art,最新技術(shù)水平)視覺 Transformer 的技術(shù)路徑,推動先進(jìn)視覺大模型從 “頭部團(tuán)隊專屬” 走向 “行業(yè)普惠”。
TuringViT 相關(guān)鏈接:
官網(wǎng):https://turingvit.github.io/
論文:https://arxiv.org/abs/2606.24253
零樣本性能、訓(xùn)練數(shù)據(jù)規(guī)模以及 vision transformer 編碼器的 1K 分辨率吞吐量。TuringViT 僅使用 10% 的訓(xùn)練數(shù)據(jù),就實現(xiàn)了比領(lǐng)先的開源基線模型更強(qiáng)的準(zhǔn)確性與效率權(quán)衡。
視覺編碼器
物理 AI 規(guī)?;涞氐暮诵钠款i
如果說世界模型承載了物理 AI 對環(huán)境規(guī)律的認(rèn)知與推演,那么視覺編碼器就是物理 AI 的 “感知入口”——所有場景理解、狀態(tài)判斷、動作決策的第一步,都始于高質(zhì)量的視覺特征提取。
隨著 VLM 與 VLA 技術(shù)快速向真實場景落地,行業(yè)對視覺編碼器的要求正在發(fā)生本質(zhì)變化:高分辨率圖像、多視角輸入、連續(xù)視頻幀成為常態(tài),端側(cè)部署對延遲與算力有嚴(yán)苛約束,不同業(yè)務(wù)場景需要定制化的視覺能力適配。而當(dāng)前主流技術(shù)路線正面臨三重普遍瓶頸:
算力成本瓶頸:標(biāo)準(zhǔn) softmax 注意力的計算復(fù)雜度隨視覺 token 數(shù)量呈二次方增長,高分辨率、多幀視頻場景下訓(xùn)練與推理成本急劇上升,難以落地端側(cè)實時場景;
數(shù)據(jù)效率瓶頸:主流高性能 ViT 依賴百億級海量圖文數(shù)據(jù)訓(xùn)練,但網(wǎng)絡(luò)數(shù)據(jù)噪聲大、標(biāo)注對齊度低,單純堆數(shù)據(jù)規(guī)模帶來的收益邊際遞減,中小團(tuán)隊難以復(fù)刻 SOTA 效果;
場景適配瓶頸:多數(shù)視覺模型采用固定分辨率預(yù)訓(xùn)練,與下游 VLM/VLA 的動態(tài)分辨率、多變長寬比輸入需求存在天然不匹配,事后適配不僅增加研發(fā)成本,還會帶來性能損耗。
行業(yè)普遍采用的 “復(fù)用開源通用 ViT” 方案,已難以匹配智能駕駛、具身機(jī)器人等真實場景對性能、延遲與定制化的綜合需求。TuringViT 正是小鵬針對這一行業(yè)痛點給出的系統(tǒng)性解決方案。
三大核心創(chuàng)新
重構(gòu)視覺大模型訓(xùn)練范式
TuringViT 從架構(gòu)、數(shù)據(jù)、訓(xùn)練三個維度同步突破,打造了 “線性注意力主導(dǎo) + 高質(zhì)量數(shù)據(jù)治理 + 原生動態(tài)分辨率” 的完整技術(shù)體系,實現(xiàn)了效果、效率與落地性的三重提升。
Turing 線性注意力:高分辨率場景實現(xiàn)近線性延遲縮放
針對 softmax 注意力在長序列下的算力困境,TuringViT 創(chuàng)新性地提出 Turing 線性注意力(TLA)作為核心計算單元,構(gòu)建 “5 層線性注意力 + 1 層標(biāo)準(zhǔn)多頭注意力” 的混合 Turing Block(XYZ) 架構(gòu)。
該設(shè)計讓線性注意力承擔(dān)主要的全局上下文聚合工作,將計算復(fù)雜度從二次方降至近線性;僅周期(883436)性插入少量標(biāo)準(zhǔn)注意力層保障 token 級交互精度,同時搭配序列長度感知歸一化與輸入依賴門控機(jī)制,在高效全局建模的同時保留局部細(xì)節(jié)與高頻視覺特征,避免線性注意力常見的細(xì)節(jié)平滑問題。
TuringViT 的塊架構(gòu)和模型配置。
(左)主干建立在重復(fù)的圖靈塊,圖靈線性注意力(TLA)聚合全局上下文;其序列長度感知歸一化和輸入依賴的輸出門可穩(wěn)定可變標(biāo)記訓(xùn)練并保持高頻局部細(xì)節(jié)。
(右)TuringViT-18L 和 TuringViT-24L 的模型配置,在共享相同補(bǔ)丁大?。?6×16)的同時,采用 2D RoPE,以塊和總層數(shù)為尺度,嵌入/頭部維度,以及多層感知器(MLP)比例。
TuringViT 共推出兩個規(guī)格版本:TuringViT-18L 包含 3 組 Turing Block(XYZ)(共 15 層 TLA+3 層 MHA),主打動態(tài)分辨率下的高效部署;TuringViT-24L 包含 4 組 Turing Block(XYZ)(共 20 層 TLA+4 層 MHA),在保持線性計算主導(dǎo)的前提下進(jìn)一步提升表征能力。
實測數(shù)據(jù)顯示,隨著輸入分辨率提升,TuringViT 的延遲增長曲線遠(yuǎn)平緩于標(biāo)準(zhǔn) softmax ViT,高分辨率下的效率優(yōu)勢愈發(fā)顯著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量達(dá)到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,為高分辨率感知、多攝像頭輸入、長時序視頻處理的端側(cè)部署掃清了核心障礙。
VISTA-Curation 數(shù)據(jù)治理:10% 數(shù)據(jù)量實現(xiàn) SOTA 級效果
不同于行業(yè) “堆數(shù)據(jù)規(guī)模” 的粗放路線,TuringViT 打造了 VISTA-Curation 多模態(tài)數(shù)據(jù)治理流水線,通過提升單樣本的監(jiān)督價值實現(xiàn)數(shù)據(jù)效率的量級提升,從 “用更多數(shù)據(jù)” 轉(zhuǎn)向 “用更優(yōu)質(zhì)的監(jiān)督”。
針對圖文數(shù)據(jù),流水線通過三步精細(xì)化篩選實現(xiàn)質(zhì)量升級:第一步過濾低分辨率、模糊、低紋理的低質(zhì)量圖片;第二步通過多模型、多提示詞生成多樣化候選字幕,并交叉驗證視覺一致性;第三步在統(tǒng)一對比池中通過相對圖文對齊度、文本信息量、歧義度綜合打分,篩選出視覺貼合度高、語義信息密度高的優(yōu)質(zhì)標(biāo)注,淘汰模糊、泛化、弱對齊的樣本。
圖像-文本篩選及處理流程
針對視頻數(shù)據(jù),流水線同樣進(jìn)行全流程治理:先將長視頻切分為連續(xù)短片段并均勻采樣代表幀;再通過語義一致性與運動一致性雙重過濾,保留語義連貫、變化信息有效的片段;最后融合局部幀級細(xì)節(jié)字幕與全局時序語義字幕,生成具備變換感知能力的視頻標(biāo)注,讓模型從連續(xù)畫面中學(xué)習(xí)更魯棒的視覺表征。
視頻-語義篩選及處理流程
最終,TuringViT 僅用 0.85B 圖文對(約為 SigLIP2-L 訓(xùn)練數(shù)據(jù)規(guī)模的 10%),便在 ImageNet-1K 等六項零樣本分類基準(zhǔn)上取得 83.6% 的平均準(zhǔn)確率,超越使用 10B 數(shù)據(jù)訓(xùn)練的主流開源基線;在 COCO、Flickr30K 圖文檢索任務(wù)上同樣優(yōu)勢顯著,真正實現(xiàn)了 “十分之一數(shù)據(jù),更優(yōu)效果” 的突破??s放律分析進(jìn)一步顯示,模型性能仍遠(yuǎn)未飽和,隨高質(zhì)量數(shù)據(jù)規(guī)模擴(kuò)大將持續(xù)可預(yù)測地提升。
原生動態(tài)分辨率訓(xùn)練:從預(yù)訓(xùn)練階段對齊下游需求
TuringViT 采用四階段漸進(jìn)式原生動態(tài)分辨率訓(xùn)練范式,從預(yù)訓(xùn)練之初就適配下游 VLM/VLA 的輸入特性,徹底告別 “固定分辨率預(yù)訓(xùn)練 + 事后適配” 的傳統(tǒng)模式。
四個階段循序漸進(jìn),逐步對齊下游真實場景:
視覺初始化階段:通過掩碼圖像建模(MIM)蒸餾 EVA02-CLIP-E 特征,完成視覺基礎(chǔ)表征學(xué)習(xí),強(qiáng)化幾何細(xì)節(jié)與高頻信息保留能力;
范圍受限動態(tài)分辨率訓(xùn)練:保留圖像原始長寬比,將長邊約束在 256-512 區(qū)間,在可控成本下讓模型提前適應(yīng)可變長度視覺 token 序列;
原生分辨率精調(diào):放開分辨率約束,盡可能保留圖像原始尺寸與比例,讓視覺預(yù)處理與下游 VLM 使用方式完全一致;
圖文視頻混合訓(xùn)練:加入經(jīng)過治理的視頻數(shù)據(jù),將靜態(tài)圖像表征拓展為具備變換感知能力的圖像 - 視頻統(tǒng)一表征,提升下游任務(wù)遷移性。
配合 Dinov3 風(fēng)格的二維旋轉(zhuǎn)位置編碼(2D RoPE),模型天然支持不同尺寸與長寬比的輸入,無需額外插值或持續(xù)訓(xùn)練適配。這種 “VLM 原生” 的設(shè)計讓視覺預(yù)訓(xùn)練與下游多模態(tài)任務(wù)無縫銜接,大幅降低集成適配成本。在統(tǒng)一 VLM 訓(xùn)練流水線的對比測試中,搭載 TuringViT 的多模態(tài)模型在目標(biāo)定位、計數(shù)、OCR 識別、文檔理解、通用視覺問答等多數(shù)任務(wù)上均優(yōu)于搭載 SigLIP2 與 MobileCLIP2 的基線方案。
全場景統(tǒng)一底座
筑牢物理 AI 技術(shù)閉環(huán)
隨著 TuringViT 的發(fā)布,小鵬全棧自研的物理 AI 底層技術(shù)能力逐步完善和豐富。小鵬的物理 AI 底層技術(shù)能力,也不僅僅服務(wù)于智能輔助駕駛,更將賦能更多物理 AI 業(yè)務(wù)場景。
賦能第二代 VLA:讓高分辨率感知真正落地車端
在智能駕駛領(lǐng)域,TuringViT 是第二代 VLA 模型的核心視覺編碼器,負(fù)責(zé)處理多路環(huán)視攝像頭的高分辨率、多幀動態(tài)道路場景輸入,為預(yù)測式世界模型提供低延遲、高質(zhì)量的視覺 token。
其近線性的延遲特性,讓高分辨率視覺感知得以在車端算力約束下穩(wěn)定運行,助力窄路通行、無導(dǎo)航輔助駕駛、復(fù)雜路口處理、長尾交通參與者識別等功能的體驗升級;進(jìn)一步釋放端側(cè)大模型的性能潛力,讓駕駛決策既 “看得清” 又 “反應(yīng)快”。
升級座艙交互:實現(xiàn)視覺與語言的自然融合
面向智能座艙(886059)與駕泊一體化場景,TuringViT 的 VLM 原生特性讓視覺特征與語言模型實現(xiàn)更高效的對齊,可以提供更高的識別精度、不同畫幅和比例的視覺輸入,以支撐更多未來的車輛與用戶交互的豐富座艙功能。
夯實具身基礎(chǔ):為 IRON 機(jī)器人打造通用視覺能力
在小鵬 IRON 人形機(jī)器人(886069)的技術(shù)體系中,TuringViT 充當(dāng)著 “視覺視網(wǎng)膜” 的核心角色,為具身智能提供物體細(xì)粒度識別、空間關(guān)系理解、可操作區(qū)域檢測、動態(tài)環(huán)境追蹤等基礎(chǔ)感知能力。
統(tǒng)一的基座架構(gòu)讓智能駕駛場景積累的海量視覺經(jīng)驗?zāi)軌蚩焖龠w移到機(jī)器人場景,大幅降低跨場景研發(fā)成本;高效的端側(cè)部署特性也適配機(jī)器人的嵌入式算力約束,加速展廳導(dǎo)覽、工業(yè)巡檢、商業(yè)服務(wù)等場景的落地進(jìn)程。
開放技術(shù)路徑 推動視覺大模型行業(yè)普惠
TuringViT 的價值不止于小鵬內(nèi)部業(yè)務(wù)的落地,更在于為行業(yè)提供了一套可復(fù)現(xiàn)、可遷移的 SOTA 級視覺大模型訓(xùn)練方法論。其核心架構(gòu)設(shè)計、數(shù)據(jù)治理流程與訓(xùn)練范式均不依賴特定硬件平臺,能夠適配不同算力環(huán)境,通過可復(fù)現(xiàn)的數(shù)據(jù)治理、訓(xùn)練與部署流程,TuringViT 有望降低高性能視覺編碼器的訓(xùn)練與定制門檻,使更多團(tuán)隊能夠在可控算力條件下構(gòu)建面向自身業(yè)務(wù)的視覺基礎(chǔ)模型。
未來,小鵬將持續(xù)擴(kuò)大高質(zhì)量圖文視頻數(shù)據(jù)規(guī)模,深化時序建模與具身視覺方向的技術(shù)探索,推動視覺基座與 VLM/VLA 系統(tǒng)的更深度融合,讓先進(jìn) AI 技術(shù)真正滲透到每一次出行、每一個交互場景,以科技突破定義智能出行與具身智能的新高度。
