IT之家 7 月 24 日消息,今日,阿里云開源發(fā)布文檔解析模型 OvisOCR2。該模型以 96.58 的綜合得分刷新 OmniDocBench v1.6 榜單紀(jì)錄,成為首個(gè)超越流水線方法并登頂該榜單的端到端模型,官方稱“這是文檔解析領(lǐng)域迎來技術(shù)路線的重要突破”。
端到端模型首次超越流水線方法
IT之家從官方公告獲悉,文檔解析是大模型落地的關(guān)鍵基礎(chǔ)設(shè)施,企業(yè)知識(shí)庫、RAG 檢索、智能問答等場(chǎng)景均需將 PDF、掃描件等非結(jié)構(gòu)化文檔轉(zhuǎn)化為結(jié)構(gòu)化文本。
此前該領(lǐng)域由“流水線方法”主導(dǎo),通常由版面分析模型和內(nèi)容識(shí)別模型兩部分組成,前者負(fù)責(zé)識(shí)別文檔布局,后者負(fù)責(zé)文字、公式、表格等內(nèi)容的識(shí)別,最后拼接輸出。這種方式雖成熟,但存在維護(hù)成本高、誤差累積、部署復(fù)雜等固有瓶頸。
OvisOCR2 采用端到端技術(shù)路線:輸入一張文檔圖像,模型在一次生成中輸出符合自然閱讀順序的 Markdown 表示,覆蓋文本、公式、表格和視覺區(qū)域。過去需要多個(gè)模型協(xié)作完成的工作,現(xiàn)在由一個(gè)模型一步到位。
在 OmniDocBench v1.6 上以 96.58 分登頂,首次證明端到端模型可超越流水線方法。
小參數(shù)大能力,0.8B 實(shí)現(xiàn) SOTA OvisOCR2 由 Qwen3.5-0.8B 后訓(xùn)練得到。團(tuán)隊(duì)構(gòu)建了真實(shí)文檔與合成文檔互補(bǔ)的數(shù)據(jù)引擎體系,合成文檔專門補(bǔ)充表格與公式交織、多欄版式、長(zhǎng)輸出等復(fù)雜場(chǎng)景。訓(xùn)練方案融合監(jiān)督微調(diào)(SFT)、強(qiáng)化學(xué)習(xí)(RL)、在線策略蒸餾(OPD)和模型融合四階段流程,形成多階段遞進(jìn)式的訓(xùn)練流程,充分釋放緊湊模型的潛力。
▲ OvisOCR2 數(shù)據(jù)引擎體系 項(xiàng)目已開源發(fā)布,無縫融入千問生態(tài)
OvisOCR2 以 Apache 2.0 許可證開源,兼容 vLLM 等主流推理框架,與 Qwen3.5 推理生態(tài)銜接,開發(fā)者無需額外適配即可集成。
