剛剛,國際AI頂級學(xué)術(shù)會議ACL 2026最佳論文獎出爐!
阿里研究團隊在Deep Research Agent方向的研究成果從全球一萬多篇投稿中脫穎而出,獲評最佳資源論文獎(Best Resource Paper),是國內(nèi)唯一獲得該獎項的中國公司。
該論文首次系統(tǒng)揭示了當前Agent在真實世界復(fù)雜規(guī)則推理中面臨的巨大缺陷,并提出了全新的專家Agent評測基準,為提升大模型在真實場景的可靠性指明了新方向。
ACL(國際計算語言學(xué)協(xié)會)是自然語言處理和計算語言學(xué)領(lǐng)域中歷史最悠久、最具權(quán)威性的國際學(xué)術(shù)組織,ACL 2026共收到12148篇投稿,僅19%被主會錄用,最終僅有4篇論文獲評Best Resource Paper。
為什么這項研究值得關(guān)注?
想象一位跨境電商(885642)賣家,要把一件商品出口到海外——他必須先給這件商品找到一個精確的10位海關(guān)編碼(HS Code)。
聽上去只是"分類",實際上卻要在一棵層層嵌套的規(guī)則樹里一路推理下去:材質(zhì)、用途、加工方式、使用場景……任何一個環(huán)節(jié)判斷錯誤,整批貨就可能被扣關(guān)或罰款。這項工作在現(xiàn)實中通常需要經(jīng)驗豐富的關(guān)務(wù)專家來完成。
阿里此次獲獎的論文以此為切入點,提出了針對真實場景和專家水平的智能體新基準 HSCodeComp:它要求Agent像資深關(guān)務(wù)專家一樣,將商品模糊的屬性與嚴格的關(guān)稅歸類規(guī)則對齊,為商品精準映射到10位細分編碼。研究團隊對14個主流大模型和9個先進Agent框架進行了全面評測。
結(jié)果令人意外:表現(xiàn)最好的Agent系統(tǒng)準確率僅為約45%,而人類專家的準確率高達95%。更值得注意的是,研究還發(fā)現(xiàn)——單純堆更多推理時間(inference-time scaling)并不能顯著縮小這道鴻溝,說明這不是"算力問題",而是 Agent 架構(gòu)本身的結(jié)構(gòu)性瓶頸。
該研究還進一步揭示了導(dǎo)致Agent系統(tǒng)缺陷的原因:首先過長的推理鏈導(dǎo)致Agent在中途偏離正確路徑,其次是領(lǐng)域知識不足導(dǎo)致規(guī)則誤用,最后由于推理幻覺造成Agent生成缺乏事實依據(jù)的分類判斷。這些發(fā)現(xiàn)為Agent能力提升指明了方向。
據(jù)介紹,阿里已基于該研究成果,在跨境貿(mào)易數(shù)字關(guān)務(wù)等場景中設(shè)計了以Qwen基座為核心的Agent框架,在HSCodeComp基準(10位編碼準確率)上的測試結(jié)果顯示,該Agent以65.0%的準確率穩(wěn)居AI系統(tǒng)第一位。
ACL評審委員會表示:“該基準切中了Agent應(yīng)用的高度重要挑戰(zhàn)——考察Agent對嚴格層級化自然語言規(guī)則的遵循能力,研究動機極具說服力;嚴謹?shù)娜祟悓<以u測流程提供了高度可靠的能力上界?!?/p>
目前,HSCodeComp基準的數(shù)據(jù)集與評測代碼已在Hugging Face和GitHub全面開源。我們希望這項工作將會啟發(fā)學(xué)術(shù)界和工業(yè)界持續(xù)進行探索,一起推動Agent走向真正可用的"專家級"。
