上證報中國證券網(wǎng)訊(記者 羅茂林)日前,百度(BIDU)文心助手任務(wù)Agent(Orion(OEC) Mission Mode)以94.6%的綜合成功率、94.4%的平均得分,在全球工程向AI智能體(886099)評測榜單PinchBench v2中榮登榜首。
在148項真實任務(wù)的綜合評測中,文心助手任務(wù)Agent超越Anthropic Claude Opus 4.8-fast、阿里千問Qwen3.7-max、英偉達(NVDA)Nemotron-3 Ultra、OpenAI GPT-5.6-luna等海內(nèi)外主流大模型。 此次PinchBench v2榜單以148項真實企業(yè)自動化任務(wù)為核心測試標準,覆蓋創(chuàng)意內(nèi)容、寫作、數(shù)據(jù)分析、研究知識、代碼運維等多維場景。據(jù)榜單數(shù)據(jù)顯示,文心助手任務(wù)Agent在創(chuàng)意內(nèi)容、寫作內(nèi)容等多個賽道獲得領(lǐng)先的評測認證,工具調(diào)用、多步驟任務(wù)自主規(guī)劃與長程任務(wù)執(zhí)行能力表現(xiàn)突出。此次評測流程,百度(BIDU)AI搜索團隊以Orion(OEC) Mission Mode的名稱,在GitHub上開源。
據(jù)悉,文心助手任務(wù)Agent依托百度(BIDU)搜索二十余年技術(shù)積累與百度(BIDU)搜索獵戶座AI引擎的多智能體框架能力,為智能體應(yīng)用開發(fā)提供了自主可控、高性能的國產(chǎn)化底層模型底座。目前,該核心技術(shù)已全面應(yīng)用于百度(BIDU)App及文心助手。
