单页 OCR 扫描通常比较准确,一旦连续处理上百页时,模型就会因显存与 KV Cache 瓶颈而“失忆”。术语前后矛盾、跨页表格断裂、页眉页脚串行等问题层出不穷。这不是识别精度问题,而是长文档的“上下文诅咒”:传统方案被迫将文档切碎处理,导致全局逻辑彻底断裂。

百度团队最新开源的 Unlimited-OCR,完美的终结了这种长文档困扰。它基于 DeepSeek-OCR 的能力底座,核心引入了一套 Reference Sliding Window Attention(R-SWA)机制。你可以把它想象成给模型装了一条记忆滑轨,这条滑轨可以保证模型处理长序列时不会再傻盯着全文做无差别注意力,而是带着关键参考信息滑动前进。既不会忘记信息,又不爆显存。整本扫描件、超长论文、多页 PDF,都能在一个上下文里一口气解析到底,真正实现「长记忆力」和「大局观」。

而且 Unlimited-OCR 不像传统 OCR 只能处理单张图片,它能够直接处理多页图片和 PDF 文档,并且自动完成版面解析与结构化输出。即使是论文里的复杂公式、跨页大表格、多级标题,报告里的图文混排,它都能直接还原成可编辑的标准格式,彻底告别了将完整文档拆分再拼接的手动时代。

教程链接:https://go.openbayes.com/O4V5y 使用云平台: OpenBayes http://openbayes.com/console/signup?r=sony_0m6v

首先点击「公共教程」,找到「Unlimited-OCR:一键部署长文档 OCR 与版面解析」,单击打开。

页面跳转后,点击右上角「克隆」,将该教程克隆至自己的容器中。

在当前页面中看到的算力资源均可以在平台一键选择使用。平台会默认选配好原教程所使用的算力资源、镜像版本,不需要再进行手动选择。点击「继续执行」,等待分配资源。

等待分配资源,当状态变为「运行中」后,点击「打开工作空间」进入 Jupyter Workspace。

页面跳转后,点击左侧 README.ipynb 文件。

点击运行,运行完毕后,Notebook 输出中会出现可点击的 public URL,大家也可以点击工作空间右侧 API 地址进入 Demo 页面。

点击右侧 API 地址即可打开 Demo 界面。

WebUI 打开后,大家可以按照页面提示上传图片或 PDF 文件,并选择解析模式。

效果展示:

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐