鳳凰網(wǎng)科技訊 7月24日,阿里云正式開源發(fā)布文檔解析模型OvisOCR2。該模型以綜合得分96.58刷新OmniDocBench v1.6榜單紀(jì)錄,成為首個超越傳統(tǒng)流水線方法并登頂該榜單的端到端模型,標(biāo)志著文檔解析領(lǐng)域迎來重要技術(shù)路線突破。
此前文檔解析領(lǐng)域由“流水線方法”主導(dǎo),需依次調(diào)用版面分析、文字識別等多個模型,存在維護(hù)成本高、誤差累積等問題。OvisOCR2采用端到端路線:輸入文檔圖像后,模型一次性輸出符合自然閱讀順序的Markdown格式結(jié)果,覆蓋文本、公式、表格和視覺區(qū)域,一個模型完成過去多模型協(xié)作的工作。
該模型由Qwen3.5-0.8B后訓(xùn)練得到,僅0.8B參數(shù)量即實(shí)現(xiàn)SOTA性能。訓(xùn)練采用監(jiān)督微調(diào)、強(qiáng)化學(xué)習(xí)、在線策略蒸餾和模型融合四階段流程,并構(gòu)建了真實(shí)與合成文檔互補(bǔ)的數(shù)據(jù)引擎體系,以充分釋放緊湊模型潛力。OvisOCR2已以Apache 2.0許可證開源,兼容vLLM等主流推理框架,可與Qwen3.5生態(tài)無縫銜接。
