近日,上海交通大學、百度(BIDU)智能云、地瓜機器人(D-Robotics)聯合發(fā)布機器人 Foundation Model 最新研究成果 dVLA-RL,首次打通經典 PPO 算法與離散擴散 Vision-Language-Action(dVLA)的強化學習訓練路徑,使離散擴散 VLA 首次具備持續(xù)強化學習能力,為機器人 Foundation Model 建立起從預訓練、監(jiān)督微調(SFT)到強化學習(RL)的完整技術鏈路,推動機器人從依賴人類示范學習,邁向持續(xù)自主學習與自主進化。
此次研究全部實驗均基于百度(BIDU)百舸 AI 計算平臺完成。針對機器人強化學習訓練場景,百度(BIDU)百舸團隊圍繞 RLInf 開展 AI Infra 工程優(yōu)化,提升了強化學習階段的訓練效率、資源利用率和模型收斂效果,為 dVLA-RL 提供了穩(wěn)定、高效的訓練支撐。
近年來,以 Vision-Language-Action(VLA)為代表的機器人 Foundation Model 正成為具身智能的重要技術路線。通過融合視覺、語言和機器人動作,VLA 模型能夠完成抓取、搬運、裝配等復雜任務,并不斷拓展機器人在制造、物流、服務等場景中的應用能力。
當前,大多數機器人 Foundation Model 主要依賴監(jiān)督微調(SFT)學習人類示范數據,能夠快速掌握基礎技能,但面對開放環(huán)境和復雜任務時,僅依靠模仿學習容易達到能力瓶頸。強化學習(RL)則通過自主交互、持續(xù)試錯和獎勵反饋不斷優(yōu)化策略,被普遍認為是機器人 Foundation Model 持續(xù)演進的重要方向。
然而,離散擴散 VLA 由于采用多輪去噪生成動作,傳統(tǒng) PPO 難以直接適配其完整生成過程,強化學習訓練路徑長期缺失,也成為制約這一技術路線進一步發(fā)展的關鍵瓶頸。
針對這一挑戰(zhàn),研究團隊提出 dVLA-RL 強化學習訓練框架,將離散擴散模型完整的去噪過程視為連續(xù)決策軌跡,重新定義 PPO 的優(yōu)化對象,使經典強化學習算法首次能夠直接應用于離散擴散 VLA,為這一技術路線建立起完整的強化學習訓練體系。同時,團隊進一步提出 Hybrid Denoising Steps 動態(tài)去噪策略,可根據不同任務復雜度動態(tài)調整去噪步數,在保證模型性能的同時兼顧推理效率。
實驗結果顯示,dVLA-RL 在多個機器人主流基準測試中取得顯著提升。在 LIBERO Benchmark(BHE) 上,模型平均任務成功率達到 99.7%;在 RoboTwin 2.0 基準測試中,模型成功率由監(jiān)督微調階段的 61.4% 提升至 92.0%,絕對提升 30.6 個百分點。與此同時,Hybrid Denoising Steps 將平均推理時延由 728.92 ms 降低至 387.24 ms,強化學習訓練耗時由 845.95 秒縮短至 607.89 秒,實現模型性能與運行效率同步提升。
作為本項研究的重要基礎設施支撐,百度(BIDU)百舸 AI 計算平臺為機器人 Foundation Model 強化學習提供了覆蓋訓練框架、算力調度和 AI Infra 優(yōu)化的一體化能力。隨著機器人 Foundation Model 加速邁向強化學習階段,高質量 AI 基礎設施正成為支撐模型持續(xù)迭代和產業(yè)落地的重要底座。依托持續(xù)升級的 AI Infra 能力,百度(BIDU)百舸正在為大模型、智能體及機器人 Foundation Model 提供更加穩(wěn)定、高效的訓練支撐。
此次 dVLA-RL 的發(fā)布,不僅首次打通了離散擴散 VLA 的強化學習路徑,也進一步完善了機器人 Foundation Model 從預訓練、監(jiān)督微調到強化學習的完整技術鏈路,為機器人持續(xù)自主進化奠定了基礎。未來,隨著強化學習、大模型與具身智能持續(xù)融合,機器人將從 " 學會執(zhí)行任務 " 進一步走向 " 持續(xù)自主學習 ",加速智能制造、物流、服務機器人等場景規(guī)模化落地。百度(BIDU)智能云也將持續(xù)攜手科研機構和產業(yè)伙伴,依托百舸 AI 計算平臺和 AI Infra 能力,推動機器人 Foundation Model 技術創(chuàng)新,加速具身智能產業(yè)發(fā)展。
