OvisOCR2 是一款超级实用的文档识别(OCR)AI模型,你给它一张文档页面照片或扫描件(比如论文、合同、报告、表格、带公式的书页等),它就能一键按正常阅读顺序,输出干净的 Markdown 格式内容。


它能同时搞定:

普通文字
复杂表格(转成 HTML 表格)
数学公式(转成 LaTeX 格式)
图表、图片等视觉区域(可以用图片标签保留)




主要特点

体积小巧:只有约 0.8B(8亿)参数,模型很轻,适合普通电脑或服务器跑。
端到端处理:不像传统 OCR 要先切图、再识别、再拼起来,它直接“看一眼整页”就输出完整结构,效果更自然、顺序更准。
性能很强:在专业文档评测基准(OmniDocBench)上拿了 96.58 分,成为第一个超过传统流水线方法的端到端模型;在另一个基准上也拿了最高分。
基于 Qwen3.5 开发,通过真实数据 + 合成数据 + 多阶段训练(SFT、RL 等)优化过,识别准确率高。



应用领域

文档数字化:把纸质文件、PDF 扫描件快速转成可编辑的 Markdown,便于存档、搜索或二次加工。
学术/科研:处理论文、arXiv 文章,自动提取文字、公式和表格。
办公自动化:合同、发票、报表、书籍扫描等的结构化提取。
知识管理:把大量文档转为结构化数据,方便做 RAG(检索增强)、建知识库。
无障碍阅读:帮助视障用户或需要纯文本版本的人获取文档内容。



使用教程:(建议N卡,显存4G起,支持50系显卡)

上传需要解析的文档(支持图像和pdf文档),点击 运行OCR 即可
 

下载地址:点此下载

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐