OvisOCR2快速摘要
OvisOCR2是阿里于2026年7月发布的端到端文档解析模型,基于Qwen3.5-0.8B后训练构建,支持文本识别、表格解析、公式识别和版面理解,适用于文档数字化、知识库构建、智能档案管理及OCR自动化处理场景。
- 开发公司:阿里国际数字商业集团 ATH-MaaS 团队
- 发布时间:2026年7月24日
- 模型类型:端到端文档解析模型
- 使用要求:支持Transformers、vLLM与SGLang部署
- 开源情况:Apache 2.0开源协议
- 技术特点:端到端架构替代传统OCR流水线,据官方技术报告显示可直接输出完整Markdown文档
- 模型规模:约0.8B参数,基于Qwen3.5-0.8B训练
- 性能表现:据2026年OmniDocBench v1.6测试数据表明综合得分96.58
- 基准成绩:据PureDocBench公开测试数据表明Avg3得分75.06
- 多模态能力:支持文本、表格、公式与视觉区域解析
- 上下文处理:支持整页文档级理解与顺序阅读重建
- API支持:可通过OpenAI兼容接口进行部署调用

OvisOCR2的核心优势
- 端到端解析优势:采用视觉语言模型架构,将版面分析、文字识别和结构生成统一处理,减少传统OCR流程误差。据OmniDocBench v1.6测试显示综合得分96.58。
- 轻量部署优势:基于Qwen3.5-0.8B后训练,约0.8B参数规模,在较低显存环境运行,同时保持文档理解能力,适合企业私有化OCR部署。
- 复杂文档优势:支持表格、公式、图文混排解析,并输出Markdown结构。据PureDocBench测试数据表明Avg3得分75.06,适合论文和报告处理。
- 结构理解优势:通过模型训练学习页面布局和阅读顺序,可处理双栏论文、合同等复杂页面,提升文档重建和知识库导入效果。
- 开源生态优势:采用Apache 2.0协议开放,支持Transformers、vLLM和SGLang部署,可用于构建OCR API和企业文档自动化系统。
OvisOCR2的主要功能
- 文本识别功能:利用视觉语言模型完成页面OCR,例如输入扫描合同图片,可输出完整文字内容,并保留段落结构,适合文档数字化场景。
- 表格解析功能:识别图片中的行列关系并生成结构化表格,例如输入财务报表截图,可输出HTML或Markdown表格数据。
- 公式识别功能:支持数学公式视觉解析和LaTeX生成,例如输入论文公式区域,可输出可编辑公式代码,方便科研资料整理。
- 版面理解功能:识别标题、正文、图片和图表区域,例如输入研究报告页面,可恢复内容层级,提高知识库构建效率。
- Markdown输出功能:直接生成结构化Markdown文档,例如输入PDF页面后输出标题、列表、表格和公式内容,减少人工整理步骤。
OvisOCR2的技术原理
- 视觉语言架构:采用VLM架构,将视觉编码器与语言模型结合,通过图像输入理解文档内容,再生成结构化文本结果。
- 监督微调训练:基于Qwen3.5-0.8B模型进行文档数据训练,使模型学习图片与Markdown内容映射关系,提升OCR解析能力。
- 强化学习优化:利用奖励机制优化阅读顺序、表格结构和公式输出质量,通过训练提升复杂文档解析稳定性。
- 数据合成训练:结合HTML渲染生成合成文档数据,为模型提供图像与结构文本对应样本,提高版面理解效果。
- 结构化生成机制:推理阶段直接生成Markdown格式结果,将文字、表格和公式统一输出,降低传统OCR后处理复杂度。
OvisOCR2与主流模型对比
OvisOCR2与主流OCR模型对比
| 对比维度 | OvisOCR2 | FireRed-OCR | Unlimited-OCR | PaddleOCR |
|---|---|---|---|---|
| 模型定位 | 端到端文档理解OCR模型 | 视觉语言OCR模型 | 多模态OCR解析模型 | 传统OCR工具框架 |
| 技术架构 | 基于Qwen3.5-0.8B后训练的VLM架构 | OCR专用视觉语言模型架构 | 多模态大模型OCR架构 | 检测+识别流水线架构 |
| 文档理解能力 | 支持版面理解、阅读顺序和结构生成 | 支持复杂文本和文档解析 | 支持多类型文档识别 | 侧重文本检测与识别 |
| 表格解析 | 支持表格结构恢复 | 支持表格内容提取 | 支持复杂表格识别 | 支持基础表格OCR |
| 公式识别 | 支持LaTeX公式输出 | 支持数学内容解析 | 支持公式识别 | 能力相对有限 |
| 输出格式 | Markdown结构化输出 | 文本及结构化结果 | 文本和文档结构结果 | 文本识别结果 |
| 开源情况 | Apache 2.0协议开源 | 开源模型 | 开源模型 | 开源框架 |
| 适用场景 | 知识库、合同、论文解析 | 企业OCR和文档分析 | 智能文档处理 | 通用OCR部署 |
OvisOCR2、FireRed-OCR和Unlimited-OCR均属于新一代视觉语言OCR模型,重点解决复杂文档理解问题。OvisOCR2基于端到端架构,更强调Markdown结构生成和知识库场景应用;FireRed-OCR侧重OCR识别与文档解析能力;Unlimited-OCR覆盖多类型OCR任务。相比传统PaddleOCR,视觉语言模型减少了多个OCR流程之间的信息损失。不同模型性能差异主要来自训练数据、模型架构和任务优化方向,实际选择需结合文档类型、部署方式和API需求判断。
如何使用OvisOCR2
- 获取模型:从OvisOCR2官方模型地址下载OvisOCR2模型文件,推荐使用BF16权重部署。配置16GB以上显存环境能够获得更稳定推理效果,并减少长文档处理时显存不足问题。
- 安装环境:安装Transformers、PyTorch与vLLM环境,Python建议3.10以上版本。部署时可设置batch size为1至4,根据GPU显存容量调整并发处理能力。
- 上传文档:输入PNG、JPG或PDF转换后的页面图像,建议分辨率保持1500像素以上。较高分辨率能够提高表格边界识别和小字体OCR准确率。
- 执行推理:调用模型生成Markdown结果,可设置最大输出长度2048至4096 token。对于学术论文和合同文件,建议提高输出长度避免内容截断。
- 结果优化:将输出Markdown导入知识库或文档系统进行校验,对于复杂表格和手写内容可进行人工复核,从而进一步提高企业级文档数字化质量。
OvisOCR2的局限性
- 长文档限制:当前模型以单页解析为核心设计,对于超长PDF仍需逐页处理后再合并结果。
- 手写识别限制:复杂手写体场景下准确率可能低于印刷文本。
- 多语言覆盖限制:目前重点优化文档解析任务,对于部分低资源语言表现仍依赖基础模型能力。
OvisOCR2相关资源
- HuggingFace模型库:https://huggingface.co/ATH-MaaS/OvisOCR2
- 魔搭:https://modelscope.cn/models/ATH-MaaS/OvisOCR2
- arXiv技术论文:https://arxiv.org/pdf/2607.13639
OvisOCR2的典型应用场景
- 企业文档处理:用于合同、报告等资料数字化,通过OCR解析和结构化整理,提高企业文档归档与检索效率。
- 学术资料整理:适用于论文、研究报告解析,可识别正文、公式和图表内容,方便科研知识库建设。
- 财务数据提取:支持财务报表、票据等文档解析,可提取表格信息,减少人工录入和数据整理成本。
- 知识库建设:可将PDF、手册等资料转换为Markdown结构内容,便于企业RAG系统和智能问答平台使用。
- 档案数字化:适用于历史文件、政务资料电子化,通过OCR识别提升档案管理和全文搜索效率。
OvisOCR2常见问题
OvisOCR2怎么用?
OvisOCR2支持Transformers、vLLM等方式部署,上传文档图片后即可生成结构化文本。建议先测试标准PDF或图片文档,并根据显存调整推理参数。
OvisOCR2免费吗?
OvisOCR2采用Apache 2.0协议开源,目前可免费下载模型并本地部署使用。使用过程中仍需承担服务器、GPU等运行成本。
OvisOCR2和FireRed-OCR哪个好?
两者均用于智能文档解析。OvisOCR2侧重文档理解和Markdown结构输出,FireRed-OCR偏向OCR识别任务,可根据知识库建设或文本提取需求选择。
OvisOCR2支持API部署吗?
OvisOCR2支持通过vLLM和SGLang构建API服务,开发者可集成到企业系统中,实现自动化文档解析功能。
OvisOCR2如何计费?
OvisOCR2官方暂未公布商业API价格,目前主要以开源模型形式提供,企业部署时需根据GPU资源计算实际成本。
© 版权声明
本站文章版权归AI工具箱所有,未经允许禁止任何形式的转载。
相关文章
暂无评论...
浙公网安备33010202004812号