ITBear旗下自媒体矩阵:

阿里云开源OvisOCR2文档解析模型,端到端技术突破登顶OmniDocBench榜单

   时间:2026-07-24 18:58:12 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

阿里云近日宣布,正式开源其最新研发的文档解析模型OvisOCR2。该模型在OmniDocBench v1.6基准测试中以96.58分的综合成绩登顶,成为首个超越传统流水线方法的端到端文档解析模型,标志着文档处理领域技术路线实现重大突破。

在传统文档解析方案中,流水线方法长期占据主导地位。这类方法通常需要部署版面分析模型和内容识别模型两个独立组件,前者负责定位文档中的文本、表格、公式等元素位置,后者则完成具体内容的识别工作。尽管技术成熟,但多模型协作带来的维护成本高、误差传递、部署复杂等问题始终难以解决。例如,版面分析的微小偏差可能导致后续内容识别完全错误,形成"差之毫厘,谬以千里"的连锁反应。

OvisOCR2采用的端到端技术路线彻底改变了这一局面。该模型通过单次生成即可输出符合自然阅读顺序的Markdown格式文档,完整保留文本、公式、表格和视觉区域等所有结构化信息。这种设计将原本需要多个模型接力完成的任务整合为单一流程,不仅简化了系统架构,更通过消除中间环节显著提升了处理精度。测试数据显示,在处理复杂版式文档时,端到端模型的错误率较传统方法降低42%。

该模型的技术突破源于创新的训练体系。研发团队构建了真实文档与合成文档互补的数据引擎,其中合成数据专门针对表格公式交织、多栏排版、长文本输出等复杂场景进行强化。在训练策略上,采用监督微调、强化学习、在线策略蒸馏和模型融合的四阶段递进式流程,充分挖掘0.8B参数模型的潜力。这种"小参数大能力"的设计理念,使得模型在保持轻量化的同时达到SOTA(State-of-the-Art)性能水平。

开源生态建设方面,OvisOCR2采用Apache 2.0许可证发布,已实现与vLLM等主流推理框架的无缝兼容。通过与Qwen3.5推理生态的深度整合,开发者可直接调用现有千问生态资源,无需进行额外适配即可快速部署。这种开放策略显著降低了技术门槛,为金融、法律、科研等领域的大量非结构化文档处理需求提供了高效解决方案。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version