文档解析,这个将PDF、扫描件等非结构化文档转化为结构化文本的关键环节,正迎来一次重要的技术路线转折。7月24日,阿里云正式开源发布仅0.8B参数规模的文档解析模型OvisOCR2。在权威文档解析基准OmniDocBench v1.6评估中,该模型以96.58的综合得分登顶,成为首个全面超越传统流水线方法的端到端文档解析模型。
从“流水线”到“一步到位”:文档解析的技术路线转折
在OvisOCR2出现之前,文档解析领域长期由“流水线方法”主导。这种方法如同一条工业流水线,需要依次调用版面分析、文字识别等多个模型。它虽然成熟,但存在三个固有瓶颈:一是维护成本高,多个模型需分别维护和更新;二是误差累积,前一个模型的错误会传递给后续环节;三是部署复杂,整个系统搭建和运维的门槛较高。
OvisOCR2选择了一条更具挑战性的技术路线——端到端模型。它摒弃了多模型协作的复杂流程,采用“一步到位”的新范式:输入一张文档图像,模型在一次生成中直接输出符合自然阅读顺序的Markdown格式结果,覆盖文本、公式、表格和视觉区域。
在OmniDocBench v1.6这一文档解析领域最权威的公开基准上,OvisOCR2以96.58分登顶,首次用实打实的成绩证明了端到端模型能够全面超越传统的流水线方法。
小参数,大能力:0.8B如何实现SOTA
OvisOCR2的突破不仅在于技术路线的革新,更在于它以极致紧凑的体量达到了最优性能。
该模型基于Qwen3.5-0.8B后训练得到。为了充分释放这个紧凑模型的潜力,阿里团队构建了独特的数据引擎体系:真实文档提供自然的页面分布,合成文档则精准补充表格与公式交织、多栏版式、长输出等复杂场景。两类数据互补共建,确保了模型在各类真实业务场景中的泛化能力。
在训练层面,团队融合了监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四大技术手段,形成多阶段递进式的训练流程。这一系列精心设计,让仅0.8B参数的OvisOCR2实现了SOTA(State-of-the-art,最优)性能。
降本增效的利器:更低门槛,更广应用
相较于动辄数十亿参数的大模型和需要两个模型叠加的流水线方法,OvisOCR2的优势在于其极低的部署门槛。它以更低的GPU显存需求、更快的推理速度、更简单的部署流程,让企业用户无需配置昂贵的算力基础设施,即可获得业界领先的文档解析能力。
文档解析作为RAG检索、智能问答与企业知识库的核心基础设施,OvisOCR2的出现意味着更多企业能够以更低的成本,将海量的PDF、扫描件等非结构化文档转化为可被大模型理解和检索的结构化数据。
目前,OvisOCR2已以Apache 2.0许可证完全开源,并上线了Hugging Face、魔搭等AI开源社区。它兼容vLLM等主流推理框架,可与Qwen3.5生态无缝衔接,开发者无需额外适配即可快速集成。
当文档解析从复杂的系统工程走向更简洁高效的模型驱动范式,OvisOCR2不仅为开发者提供了一个强大的开源工具,更验证了一条新的技术路径的可行性。它用0.8B的轻量身躯,证明了端到端模型在文档智能领域的巨大潜力。
