核心摘要与关键结论

2020-2025 年,文档解析技术完成了从 “传统 OCR 模块化流水线” 向 “多模态视觉语言模型(VLM)端到端解析” 再到 “智能体(Agent)驱动认知理解” 的三阶段跃迁,彻底跨越了 “像素抄录” 到 “内容理解” 的技术鸿沟。这一变革的核心驱动力,是 GPT-4V、Gemini、Qwen-VL 等多模态大模型的成熟 —— 这类模型具备原生图像处理能力,可直接将文档页面作为视觉输入,而非单纯依赖 OCR 的文本输出,为后续结构与语义理解奠定了关键基础。

从技术流派维度看,2025 年行业已形成 “模块化流水线”“通用多模态大模型”“解析专用轻量化 VLM” 并存的三元格局:轻量化专用 VLM 是兼顾精度与工程化落地的最优解,代表工具如 MinerU2.5、Docling v2 等,已成为行业主流选择;混合架构则是企业级生产环境的核心方案,将轻量化 VLM 的高精度处理能力与传统流水线的低成本优势结合,适配不同文档场景的差异化需求。随着 2026 年国内一批新型轻量化文档模型公开,OvisOCR2、HunyuanOCR、Youtu-Parsing、HPD-Parsing 进一步丰富了轻量化 VLM 技术路线,推动端侧、高吞吐场景落地。

场景适配层面,技术选型的边界被进一步明确:学术论文的多栏排版、复杂公式、跨页表格等元素对解析精度提出了极高要求,轻量化专用 VLM 是目前的最优方案;通用文档场景下,需综合考虑文档格式的复杂程度、部署成本、延迟阈值等因素,在混合架构与轻量化 VLM 之间进行权衡;无 OCR 技术并非 “银弹”,在高延迟、资源受限的端侧场景中,传统 OCR 仍发挥着不可替代的作用。

智能体驱动解析是 2025 年后的重要技术拐点,其设计理念是将完整文档处理任务拆解为 “文档分类→内容提取→校验评估→业务写入” 的子任务集,由规划、执行、判验等不同专精智能体分工协作,具备动态路由、按需解析、跨文档关联等特性,可大幅提升复杂场景的处理精度。但受限于智能体调度的工程复杂度,其落地进度慢于预期,目前仅在金融、制造等行业的部分复杂场景中得到验证。

1. 技术发展演进:从流水线到智能体认知

2020-2025 年的技术跃迁,并非对前代技术的简单迭代,而是根源于核心架构逻辑的颠覆 —— 每一次范式转移,都是对前序技术核心痛点的针对性解决。整个发展历程清晰划分为三个典型时代,每个时代的技术架构、核心优劣、适用场景均存在本质差异。

1.1 时代一:模块化流水线(2020-2022)

这一阶段是文档解析技术的 “工业化普及期”,核心逻辑是 “分而治之”—— 将解析任务拆解为版面分析、文字识别、表格提取等独立工序,每个环节匹配专门的高精度模型,再串联成完整处理流水线。
底层算法谱系:
1)版面分析:主流基于YOLOv4/v5、Mask R-CNN目标检测网络;骨干网络为 CSPDarknet、ResNet。输入文档图像,输出区块包围框(标题、正文、表格、图片、页眉页脚);部分方案采用 LayoutLM 前置文本序列特征辅助,但尚未实现图像与文本深度融合。
2)文字识别:识别主干为CRNN+CTC 损失;PaddleOCR 在此基础上引入 DB(Differentiable Binarization)可微分二值化做文本检测,检测分支 DB + 识别分支 CRNN 形成标准组合;后续引入 SVTR 取代 CRNN,基于 Transformer 单层全局建模,提升倾斜文本识别能力。
3)表格解析:PPStructure 采用YOLO 检测表格区域 → 行 / 列线分割 U-Net → 单元格重组算法;基于几何规则匹配单元格邻接关系,不存在全局语义建模。
4)公式识别:Mathpix、早期 UniMERNet 采用 CNN+Seq2Seq 架构,将公式图像序列化为 LaTeX 字符串。

当时的主流技术组合,是 “YOLO 系列目标检测模型做版面分析 + PaddleOCR(DB+SVTR)做文字识别”,表格提取则搭配专用工具如 PPStructure。其技术逻辑是先用 YOLO 检测标题、正文、表格、图表等不同区块,再对各区域分别进行 OCR 识别,最终整合提取结果。这类方案的核心优势,是技术成熟度高、适配成本低,在标准商务文档、普通扫描件等简单场景下具备稳健的处理能力。

但随着文档格式的迭代,流水线架构的固有缺陷逐渐暴露:最突出的是 “错误传播” 问题 —— 作为串联式架构,上一个环节的微小偏差会随着流水线流程逐级放大,比如版面分析时将表格边框误判为正文分隔线,就会导致后续整个表格识别逻辑错位;其次,多栏排版、跨页表格等复杂布局下,流程断裂风险显著上升;更关键的是,这种架构完全基于视觉特征和规则匹配,对文档的语义逻辑毫无感知 —— 比如无法识别图表内部的标注文字与正文的上下文关联,也无法区分页眉页脚与正文内容的层级差异。

在这一阶段,学术场景的技术方案与通用文档存在明显差异:学术论文的多栏排版、复杂公式、图表与正文分离等特性,对流水线架构的核心短板形成了极致考验。当时的方案主要通过工具组合来适配学术场景的特殊需求:使用 Mathpix 这类专用 CNN+Seq2Seq 工具识别公式、用 Cermine 基于正则与 CRF 条件随机场提取参考文献、借助自定义规则模板来匹配多栏排版的阅读顺序。这类方案虽然在部分场景下可用,但存在系统割裂、人工干预多、维护成本高等缺陷。

关键局限根源:检测、识别、表格重构模型独立训练,不存在共享特征空间;图像视觉信息与文本序列信息属于两条独立链路。

1.2 时代二:视觉语言模型(VLM)端到端解析(2023-2024)

2023 年,随着 GPT-4V、Gemini 等多模态大模型的技术突破,文档解析行业迎来首次技术范式跃迁 —— 技术路径从 “模块化拼接” 转向 “端到端融合”,核心是将文档页面视为完整的视觉输入,而非割裂的版面区域或纯文本流;这一阶段的技术革新,首次实现了文档 “结构与语义的一体化理解”。

这一范式的核心技术路线分为两类,并行发展且差异显著:

  • 通用多模态大模型路线:以 GPT-4o、Gemini 3 Pro、Claude 3.5 Sonnet 为代表。 基础架构:ViT 视觉编码器 + LLM 文本解码器;图像切片编码后作为前缀输入大语言模型。 优势:无需任何专用训练、无需额外的 OCR 管线,直接将完整文档页面作为视觉输入,一步输出结构化的解析结果。 短板:面向通用图像任务,没有针对文档高分辨率、密集文字、布局拓扑做专项优化;计算成本极高,需要 A100 级别的高端 GPU 支撑推理;对表格、公式、多栏排版精度不足。

  • 解析专用轻量化 VLM 路线:2024–2026 持续迭代,代表:MinerU、Docling、TextMonkey、GLM-OCR、Nougat;后续衍生 OvisOCR2(阿里 0.8B)、HunyuanOCR(腾讯 1B)、Youtu-Parsing、HPD-Parsing(百度)。 通用架构设计特征 1)视觉分支:高分辨率 ViT / InternVL 轻量化 Backbone;支持分块多尺度图像编码; 2)布局感知模块:引入空间坐标编码、位置嵌入,建模区块相对位置、阅读顺序拓扑关系; 3)语言分支:轻量化 Transformer Decoder,直接输出 Markdown、LaTeX 结构化序列; 4)训练范式:在海量 PDF 文档截图、学术论文、财报数据上做文档专项预训练。

典型方案技术细节:

  1. Nougat(Meta 2023):纯 Transformer 编码器 - 解码器,直接渲染 PDF 页面图像,输出 Markdown;缺点:对中文、复杂表格适配弱。
  2. MinerU(2024):Decoupled 双引擎架构:全景粗检测模型 + 局部高清识别 VLM;先用轻量检测模型划分页面区块,对表格、公式区域放大局部送入 VLM 识别;后续 MinerU-Popo 增加全文后处理模型,实现跨页一致性校正。
  3. GLM-OCR(智谱):布局拓扑编码器,将空间位置特征融合进多模态特征,OCR-Free 端到端生成结构化文档。
  4. OvisOCR2(阿里,0.8B,2026):极小参数量单轮整页解析,优化窗口注意力机制,降低显存占用,端侧友好。
  5. HunyuanOCR / Youtu-Parsing(腾讯):高并行解码策略,优化自注意力掩码,表格并行识别,大幅降低解码时延;引入手写体、印章专项数据。
  6. HPD-Parsing(百度飞桨,2026):层级并行文档解析,搭配 P-MTP 渐进深度多 token 预测,压缩解码步数,推理吞吐提升 3 倍。
    MinerU2.5 仅需 1.2B 级别的轻量化参数,即可实现复杂布局内容的高精度提取,综合精度超过 GPT-4o 与 Gemini2.5-Pro;TextMonkey 在 OCRBench 综合评测基准中,得分比同参数级别的通用模型高出近 10 个百分点。

这一阶段的技术突破,彻底解决了流水线架构的核心痛点:VLM 的原生视觉特征对齐能力,天然保留了文档布局的整体结构、文字与图表的上下文关联,从根源上切断了错误传播链路;其语义理解能力,也为下游 RAG、知识库构建等业务提供了高质量的结构化数据。但这一技术路线仍存在不足:资源消耗较大,推理速度难以满足高并发场景的要求;对复杂布局、低质量扫描件的处理精度仍有待提升。

在学术场景中,2024 年出现了多个针对性优化的开源方案:其中最具代表性的是 MinerU2.5,它针对学术论文的多栏排版、公式、图表等元素做了专门适配,将解析后的 Markdown 格式与 Mathpix Markdown 标准做了兼容,保障了公式与排版的完整性;另一款专用工具 Nougat 同样针对学术场景做了优化,支持批量处理与 API 调用,输出格式与主流学术写作工具链无缝衔接;inscriber 则实现了本地全离线化运行,适配了学术文献的隐私化处理需求。

1.3 时代三:智能体驱动的认知解析(2025- )

2025 年,行业进入 “智能体驱动的认知解析” 时代 —— 这是一次从 “识别” 到 “理解” 的本质跨越。与前两类技术范式的核心差异在于,智能体架构不再局限于单一模型或流水线的线性处理逻辑,而是将文档处理任务,动态拆解为 “理解文档整体布局→定位目标内容区域→精准提取相关内容→校验提取结果” 的多阶段流程,由多个具备专项能力的智能体串行 / 并行协作、分节点处理。其核心目标,是适配真实世界中千差万别的文档格式,以及下游多样化的业务语义需求。

底层核心算法框架:

  1. 规划智能体:文档分类器 + 路由决策大模型;输入文档缩略图 / 低分辨率预览,输出文档类型(学术论文 / 财报 / 普通合同)、复杂度评分,生成任务执行方案,动态选择调用 OCR、轻量化 VLM、专用公式模型。

  2. 执行智能体:标准化工具调用封装层,作为统一入口调度各类解析模型(MinerU、OvisOCR2、PaddleOCR、UniMERNet)。

  3. 判验智能体:两种校验范式:

    1. 自一致性校验:多次采样解析结果做对比;

    2. 领域规则校验:表格勾稽关系、参考文献格式、公式语法校验;发现冲突触发回溯重识别。

  4. 特征总线 / 共享内存:多智能体之间传递多模态特征、页面坐标、中间解析结果,避免重复推理。

典型框架如 MDocAgent,采用 “双 RAG 流水线 + 五阶段智能体协作” 架构,并行处理文本与视觉信息,再由专属智能体融合生成最终结果;MACT 框架引入自适应推理时缩放(Test-Time Scaling),根据文档布局复杂度动态调整 VLM 输入分辨率,实现精度与算力平衡;华为 Doc-Researcher 增加跨文档检索智能体,支持多篇文献之间信息关联比对。部分框架还引入了具身交互反馈循环机制,迭代缩小目标检索范围,提升解析精度。

这一阶段的技术革新,解决了长期存在的 “场景适配性” 痛点:智能体架构可以根据不同文档的质量、类型,动态选择适配工具 —— 比如先通过轻量化 VLM 理解文档布局结构,再调用专用工具提取关键内容,最后由大模型统一校验结果。这既保留了 VLM 的端到端精度优势,又具备了流水线的灵活可扩展能力,天然适配混合文档的处理需求。

同时,智能体架构并非完全脱离前序技术的独立变革:在实际落地中,它往往以 VLM 作为核心 “感知大脑”,再辅以传统 OCR、专用解析工具作为 “手脚”。比如在处理低质量扫描件时,智能体可以调用传统 OCR 先进行预处理;在处理复杂表格或公式时,切换到轻量化专用 VLM;在处理简单文本时,直接调用成熟的 OCR 工具。这种 “大脑 + 手脚” 的组合模式,继承了以往所有技术的优势,进一步提升了复杂场景的综合处理能力。

三代技术核心算法对比

技术时代 架构范式 核心算法网络 特征建模范围 典型误差来源
模块化流水线 (2020-2022) 串联分治 YOLO+DB+CRNN/SVTR、U-Net 局部视觉特征,无全局布局语义 错误逐级传播、多栏阅读顺序错乱
VLM 端到端 (2023-2024) OCR-Free/OCR-Less 多模态融合 ViT + 轻量化 Decoder,引入空间位置编码 整页视觉 + 文本联合特征 超长文档显存高、跨页信息割裂
Agent 认知解析 (2025-) 多智能体协同调度 VLM 感知模型 + LLM 规划 / 校验模块 单页特征 + 多任务全局决策 多智能体调度复杂、链路延迟上升

2. 核心技术方向深度解析

2020-2025 年文档解析技术的探索方向,是围绕 “解决真实场景痛点” 的目标演进的 —— 从 “提升单环节识别精度”,到 “端到端结构语义理解”,再到 “多模态多任务协同的认知级理解”。其中,无 OCR(OCR-Free/OCR-Less)解析、多模态 VLM 融合、智能体协同架构,是支撑整个行业技术跃迁的三大核心方向。

2.1 无 OCR(OCR-Free)/ 无需 OCR(OCR-Less)解析技术

这是 2023 年后的技术核心热点,也是实现端到端解析的底层支撑。其技术逻辑并非完全剔除 OCR,而是绕开了 “OCR 先提取文本、再做布局分析” 的传统技术路径 —— 将文档页面视为完整的视觉输入,直接通过 VLM 一次性输出结构化的文本内容与布局信息;在这个过程中,视觉特征与文本特征在模型内部完成了天然对齐,无需额外的信息拼接环节。

从技术实现路径上,主要分为两类方案:

  • 无 OCR 端到端方案:以 MinerU、TextMonkey、GLM-4V-Flash、OvisOCR2、HunyuanOCR、HPD-Parsing 为代表,完全跳过传统 OCR 的文本提取环节,直接将文档图像输入多模态模型,一步输出结构化的解析结果。这类方案的优势是架构极简、误差传递链路短,在复杂布局、低质量扫描件场景下的精度表现更优;其中 GLM-4V-Flash 还支持 Base64 格式图像直接输入,整个解析流程可完全在内网或离线环境下运行,满足了金融、政务等敏感文档私有化部署的要求。

  • OCR-Less 混合方案:以 ColPali、inquirerbr 为代表,将少量 OCR 结果与多模态特征向量融合对齐,以提升检索与溯源性能。这类方案保留了 OCR 提取的文本信息,但不再将其作为唯一的信息输入源,而是与视觉特征、布局特征拼接融合,生成更丰富的文档表示 —— 既避免了纯 OCR 方案的布局断裂问题,又保留了 OCR 文本的高检索效率;典型案例如 ColPali,完全重构了文档检索的底层逻辑,将页面级视觉特征、布局的拓扑结构特征与 OCR 文本特征融合,大幅提升了跨文档检索的精度。

根据 DISCO 基准评测数据,无 OCR 方案的综合性能显著优于传统 OCR 流水线:字符级错误率降幅达 87%,在表格结构还原、布局分析的鲁棒性方面,也比传统 OCR 提升了近 30 个百分点。但这类技术也存在明显的技术边界:推理计算资源成本高,对部署环境的 GPU 配置有一定要求;在处理简单文本、高压缩比文档时,精度提升有限;在资源受限的端侧设备场景下,速度与精度的综合表现仍无法满足实时业务需求。

2.2 多模态视觉语言模型(VLM)技术

这是支撑端到端解析与智能体任务理解的核心基础技术,其本质是通过模型的视觉编码器与语言编码器,协同输入文档的视觉、布局、文本三类特征 —— 这也是文档解析区别于普通图像识别的关键所在。

从技术架构维度看,2020-2025 年行业内的探索方向,集中在三类不同路径上,各有明确的适配场景:

  • 通用多模态大模型:以 GPT-4o、Gemini 3 Pro、Claude 3.5 Sonnet 为代表,这类模型参数规模大,基于通用 ViT+LLM 架构,具备原生强语义理解能力,能直接从文档图像中提取出结构化信息,在简单商务文档、纯文本为主的场景下表现优异,但这类模型的专项精度不足、部署成本极高,优先适配云上简单文档的处理场景。

  • 解析专用轻量化 VLM:以 MinerU、Docling、TextMonkey、GLM-OCR、OvisOCR2、HunyuanOCR、HPD-Parsing、Youtu-Parsing 为代表,是行业内工程化落地的主流选择。 架构共性优化点: ① 视觉编码器适配文档高分辨率图像,支持切片滑动窗口推理; ② 引入空间位置编码,建模布局拓扑、阅读顺序; ③ 解码器针对结构化输出(Markdown、LaTeX)专项训练; ④ 大量文档领域数据预训练,区别于通用图文 VLM。

这类模型参数规模普遍控制在 0.8B–10B 之间,既保留了端到端的理解能力,又大幅降低了部署成本,在学术论文、金融财报等复杂文档场景下,综合精度表现优于同参数级别的通用模型。

  • 多模态混合架构:这是 2025 年企业级生产环境的主流选择,核心逻辑是 “轻量化 VLM 作为核心处理大脑,传统 OCR / 专用工具作为补充手脚”—— 用轻量化 VLM 处理复杂布局、表格和图表,再用成熟的 OCR 工具处理简单文本,或用 UniMERNet 专用工具补充公式、图表的细节级识别。这类方案在保证高精度的前提下,将部署成本、开发难度控制在可接受区间内。

同时,行业内形成了一套标准化的技术组合,来适配复杂文档的多模态解析需求:采用 YOLO 系列模型检测图表、公式和表格区域,用 UniMERNet 等专用工具识别提取复杂公式,再由轻量化 VLM 统一理解布局与语义 —— 这也是当前复杂文档解析的最优技术配置。

在性能表现方面,根据 OmniDocBench、Real5-OmniDocBench 等权威基准的公开数据,轻量化专用 VLM 的综合表现已显著优于传统流水线方案:在文字识别精度维度,字符级准确率提升至 96% 以上;在结构理解能力维度,表格结构还原准确率提升至 94% 以上;在语义理解效果维度,关键信息抽取准确率提升至 92% 以上。

2.3 智能体(Agentic)驱动的解析技术

这是 2025 年后的技术前沿趋势,也是文档解析技术从 “数字化” 迈向 “认知化” 的关键支撑。其核心逻辑是将文档解析任务,拆解成 “理解布局→定位目标→提取内容→校验结果” 的多阶段工作流,由多个具备专项能力的智能体分工协作 —— 每个智能体独立完成专属子任务,再通过标准化链路串联输出,最终实现复杂文档的 “按需解析”。

从技术架构上看,主流方案分为两类,分别适配不同级别的复杂场景:

  • 单智能体编排架构:以 AWS、阿里云的企业级文档处理方案为代表,由一个编排智能体统筹任务接收、文档分类、工具调用、结果整合、校验输出全流程,适配格式标准、内容简单的普通文档场景。

  • 多智能体协同架构:这是当前的技术研究热点,典型框架如 MDocAgent、MACT,以及华为的 Doc-Researcher。这类架构将解析任务拆分为更细粒度的子任务,由规划、执行、判验、溯源等专项智能体分工处理;不同智能体之间通过标准化的多模态特征总线交互数据,共同完成复杂文档的解析任务 —— 适配多格式、混排等高复杂度文档场景。

其中,多智能体协同架构的核心优势,是在保留端到端精度的同时,具备可扩展、高容错、工具调用灵活的特性,完美匹配真实企业级场景的处理需求:比如在处理财务审计报告时,规划智能体先识别出文档中的财务表格,执行智能体调用轻量化 VLM 提取表格数据,判验智能体根据表格间的勾稽关系校验数据准确性;如果发现数据冲突,会自动回溯到原文档,重新识别相关区域,大幅减少人工校对工作量。

这一技术的关键创新点,在于 “按需解析” 的动态路由机制:智能体先对文档的布局结构进行全局预扫描,识别出文档类型和核心内容区域后,再根据下游业务任务的实际需求,定向抽取目标区块的内容,而非对整页内容进行全量识别。这既避免了无效内容的干扰,又大幅减少了无效的 token 消耗,有效降低了解析成本。

同时,智能体架构并非完全独立的技术路线:在实际落地中,它往往以轻量化 VLM 作为核心 “感知大脑”,再辅以传统 OCR、专用解析工具作为 “手脚”。比如在处理低质量扫描件时,智能体可以调用传统 OCR 先进行预处理;在处理复杂表格或公式时,切换到轻量化专用 VLM;在处理简单文本时,直接调用成熟的 OCR 工具。这种 “大脑 + 手脚” 的组合模式,继承了以往所有技术的优势,进一步提升了复杂场景的综合处理能力。

3. 重点场景技术适配分析

根据用户对 “通用文档”“学术论文” 两类 PDF 解析场景的重点需求,结合上文中的技术演进与核心技术方向细节,本节针对性展开两类场景的技术适配分析,并补充行业内的综合选型建议。

3.1 学术论文 PDF 解析

这是所有文档解析场景中技术要求最高的一类,核心技术难点在于学术论文的复杂版式、专用元素以及对解析精度的严苛要求 —— 不仅要提取文本,还要完整保留多栏排版、复杂公式、跨页表格、参考文献、图表标题与正文的关联逻辑,且解析后的内容必须保留完整的可学术溯源性。

这类场景的技术选型导向十分明确:优先选择对学术场景做过专项优化的轻量化解析专用 VLM。这类模型的技术适配性,精准匹配了学术场景的几类核心需求。

  • 针对论文的多栏排版、纸张边距、页眉页脚等干扰项,这类模型在布局分析时会自动过滤冗余区域,精准识别正文的阅读顺序,保障解析内容的连贯性;

  • 针对论文中大量的特殊格式公式,这类模型训练时补充了大量学术公式数据集,能够精准识别复杂的上下标、分式、根式,将其转换为标准的 LaTeX 格式;

  • 针对论文中的跨页表格、多栏表格,这类模型会先对表格的整体结构做逻辑还原,再识别表格内容,保障表格的单元格不错位;

  • 针对论文中的图表,这类模型会在布局分析时将图表区域识别为独立的内容块,并主动将图表标题、注释与对应内容做关联匹配。
    从具体工具选型来看,根据 Applied AI、shturl 等权威机构的实测报告,行业内形成了成熟的工具组合方案:

  • 核心解析工具:优先选择 MinerU2.5 或 Nougat。这类轻量化专用 VLM 对学术文档的复杂元素做了针对性优化,输出的 Markdown 格式与 Mathpix Markdown 标准兼容,完整支持 LaTeX 公式、表格格式的往来,解析精度优于通用多模态模型;

  • 辅助工具链:搭配 UniMERNet 等专用公式识别工具,作为轻量化 VLM 的补充,用来识别模型无法处理的低分辨率、复杂套嵌公式;搭配 Marker 工具,将解析后的内容直接转换为 LLM 可直接读取的格式,方便后续注入学术知识库。
    在实际技术落地中,虽然这类方案在精度、格式兼容性上表现优异,但仍存在部分技术盲区:比如对论文中手绘类的实验草图、模糊扫描件中的公式识别精度仍有波动,需要额外增加人工校验的环节,尤其是关键的公式和表格内容,需要与原文进行比对确认。

3.2 通用文档 PDF 解析

这类场景的技术复杂度低于学术论文,但技术选型难度更大,核心原因在于企业级通用文档的复杂性、多样性极强 —— 输出格式、布局复杂度、以及业务下游对解析精度的要求差异度极大。这类场景的技术选型,需要在解析精度、部署成本、处理效率三个维度上做多目标权衡,没有单一方案能覆盖所有子场景。

从技术选型逻辑来看,行业内的主流方案是 “基于文档复杂度与业务需求的分层路由模式”,即根据不同子场景的核心技术要求,选择适配的技术架构,实现成本与效果的平衡。具体分为三类典型子场景,对应不同技术选择:

  • 简单标准化文档场景:如标准商务文档、内部报告等,这类文档的格式规范、布局简单、没有复杂的表格或公式,内容以文本为主,对解析速度的要求较高。技术选型上,传统的 “YOLO 版面分析 + PaddleOCR 文字识别” 流水线方案完全可以满足需求,这类方案部署成本低、处理速度快,在这类场景下的综合表现优于多模态类方案。
  • 复杂业务文档场景:如金融财报、行业研究报告、工程文档等,这类文档的格式不固定、布局复杂,存在大量跨页表格、复合式图表、多栏排版内容,对解析精度和结构保真度的要求较高。技术选型上,轻量化解析专用 VLM 是最优选择 —— 如 MinerU、Docling、HunyuanOCR、HPD-Parsing 等,既具备端到端的语义理解能力,又兼顾了工程化落地的成本,可将这类文档一次性输出为结构化的 Markdown 或 JSON 格式。
  • 混合文档集合场景:如企业知识库、档案系统等,这类场景下文档来源多样、格式不一,对解析的综合容错能力要求极高。技术选型上,智能体驱动的混合架构方案是行业标配:先由智能体对文档进行分类预处理,再根据不同文档的质量、类型,动态选择适配工具 —— 简单文档调用传统 OCR 处理,复杂文档切换到轻量化 VLM,最后由智能体统一校验输出结果。这类方案将轻量化 VLM 作为核心 “感知大脑”,传统 OCR、专用解析工具作为补充 “手脚”,在保证精度的前提下,具备覆盖全格式文档的适配能力。

从工具选型维度看,根据 shturl 的实测基准、Applied AI 的综合评测报告,通用文档场景下的主流工具选型及适配逻辑如下:

  • 轻量化 VLM 类工具:以 MinerU、Docling v2、TextMonkey、OvisOCR2、Youtu-Parsing 为代表,综合表现最优,适配绝大多数复杂业务文档场景;
  • 混合架构类工具:以 PaddleOCR+PPStructure、Azure Form Recognizer 为代表,适配文档格式标准、有大量简单文档的场景;
  • 智能体编排类工具:以 AWS LandingAI、实在智能 Agentic Document AI 为代表,适配企业级混合文档的处理场景。

部分头部厂商还会根据评测结果设计专属的路由适配策略:如部署多套不同技术路线的解析工具,由智能体根据文档类型、业务精度要求,动态选择适配的工具,在保证解析效果的同时控制部署成本。

3.3 场景选型综合建议

综合行业实测数据与落地案例,两类场景下的技术选型建议明确如下:

表 1 不同场景下的技术选型建议

维度 学术论文 PDF 解析 通用文档 PDF 解析
主流技术架构 轻量化解析专用 VLM 轻量化 VLM / 混合架构 / 智能体编排(按需选择)
核心开源工具栈 MinerU2.5 + Nougat + UniMERNet MinerU / Docling / HunyuanOCR / HPD-Parsing + PaddleOCR
商业方案参考 Mathpix、Elicit、Scholarcy 阿里云智能文档处理、TextIn ParseX、MinerU Pro
关键解析能力要求 公式、多栏排版、表格、参考文献、图表关联还原 表格、布局、阅读顺序、文本保真度
下游核心适配需求 学术研究、知识库构建、文献综述 企业知识库、RAG、业务系统自动化接入
技术优势 兼顾精度与开放格式适配,支持离线私有化部署 灵活适配多类型文档,成本、效果平衡可控
技术短板 对手绘类图表、低质量扫描件解析能力有限 复杂文档的解析效果依赖于前置的文档分类精度

需要说明的是,表 1 中的选型建议是综合行业实测数据的通用结论,实际落地中需要根据业务的具体文档集合、下游精度要求、部署成本约束做针对性调整。

4. 技术文献与代表性项目综述

2020-2025 年,文档解析技术在学术研究与工程落地层面均取得了显著突破,整体呈现 “学术研究驱动技术突破、头部项目沉淀行业标准” 的发展逻辑 —— 基础理论层面的突破由学术论文驱动,技术方案的工程化落地则由头部开源项目与商业方案主导。

4.1 关键技术文献

从学术演进脉络看,2020-2025 年的文档解析技术研究,主要沿 “模块化流水线→端到端 VLM→智能体认知解析” 的主线递进,三大技术方向均有顶会论文作为关键技术支撑。以下按技术方向梳理核心文献:

4.1.1 技术综述类

这类论文对行业技术演进路径进行了系统性梳理,是技术研究的重要参考基准:

  • 《Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Data Extraction》(arXiv 2024):全面综述了文档解析技术的发展历程,将技术路线明确划分为 “模块化流水线” 与 “端到端统一模型” 两大类别,系统对比了两类方案在不同场景下的技术优劣,详细分析了布局分析、表格识别、多模态融合等核心技术的发展现状,是该领域的重要参考文献。
  • 《A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends》(ACL 2026):聚焦多模态文档理解的最新进展,系统梳理了多模态技术从早期融合到端到端架构的演进路径,详细剖析了 “模态割裂”“阅读顺序识别” 等核心痛点的技术解决方案;文中指出,智能体是未来文档解析技术的重要发展方向,需要进一步强化多工具协作的能力。
  • 《From OCR to Agents: The Three Eras of Document AI》(Docrew.ai 2026):行业内的主流技术白皮书,由头部厂商的技术团队联合编撰,从工程化落地的视角,将文档解析技术的发展清晰划分为 “传统 OCR 流水线、多模态 VLM 端到端解析、智能体驱动的认知处理” 三个时代,重点分析了不同技术路线的适用场景与落地边界。
4.1.2 多模态与无 OCR 技术类

这类论文奠定了端到端解析的技术基础,是轻量化专用 VLM 的核心理论支撑:

  • 《MinerU: An open-source solution for precise document content extraction》(arXiv 2024):MinerU 项目的配套技术论文,详细阐述了其 decoupled 视觉 - 语言架构的设计逻辑。该方案的核心创新点是 “全景布局粗检测 + 局部高清细节识别” 的双引擎架构 —— 先通过轻量化模型对文档布局做全景级的粗粒度检测,识别出正文、表格、图表区块,再对目标区域进行局部高清解码,保障小字、复杂表格的识别精度;在 OmniDocBench、PubTabNet 等权威基准上,该方案的综合表现均达到了行业领先水平。
  • 《TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document》(arXiv 2024):无 OCR 技术路线的代表性学术成果,该方案在多模态模型内部引入了 “空间坐标编码” 模块 —— 将文档的视觉特征、文本特征、布局的拓扑结构特征进行深度对齐,直接生成结构化的解析输出。在 OCRBench 综合评测基准中,该模型得分比同参数级别的通用模型高出近 10 个百分点;在表格结构还原、阅读顺序识别的评测中,表现优于通用多模态模型。
  • 《Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing》(OpenReview 2025):融合了强化学习技术的创新性解析方案,核心是设计了一种 “布局感知奖励模型”—— 通过强化学习的训练策略,让模型在识别过程中主动参考布局特征,对识别结果进行持续性的动态校验,迭代式识别出文档的阅读顺序,大幅提升了复杂布局文档的识别精度;在 OmniDocBench、olmOCR-Bench 等权威基准上,该方案的综合表现均达到了行业领先水平。
  • 《GLM-OCR: An Efficient OCR-Free Document Parsing Framework》(arXiv 2025):介绍了一种无 OCR 的文档解析框架,核心是在多模态模型中引入了 “布局的拓扑结构编码器”—— 将文档的空间位置关系、阅读顺序等特征转化为语义特征的一部分,实现了视觉、布局、文本三类特征的深度融合;在保证高精度的同时,降低了部署门槛,适配企业级高并发文档处理场景。
  • OvisOCR2: A 0.8B Model Parses Whole Pages in One Pass(阿里,2026) 超小规模 OCR-Free 文档解析模型,仅 0.8B 参数;优化窗口注意力降低显存开销,支持整页图像一次性解析;在 OmniDocBench 取得领先成绩,适合私有化、边缘部署场景。

  • HPD-Parsing: Hierarchical Parallel Document Parsing(百度飞桨,2026) 层级并行解析架构,基于 InternVL3.5-1B Backbone,搭配 P-MTP 渐进深度多 Token 预测;并行解码机制大幅压缩解码步数,高吞吐场景推理效率提升 3 倍,原生融入 PaddleOCR 生态。

  • Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding(腾讯优图,2026) 高并行解码多模态文档模型,针对表格、手写文字、印章优化;并行单元格识别机制,表格解析速度提升 26 倍,同时支持扫描件与电子 PDF 双场景。

  • HunyuanOCR(腾讯混元,2026) 1B 参数端到端 OCR-Free 模型,支持 331 种语言;采用分辨率动态调度策略,兼顾印刷体、手写体识别,兼顾云端并发与轻量化部署。

  • MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing(上海 AI Lab,2026) 面向整篇长文档的后处理校正模型;弥补单页 VLM 割裂缺陷,实现跨页表格、参考文献、图文关联全局一致性修正,打通 “单页解析” 走向 “全文理解”。

4.1.3 智能体与多模态协同技术类

这类论文代表了行业技术的最新发展方向,重点解决复杂场景的综合处理问题:

  • 《MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding》(OpenReview 2025):提出了一种面向文档理解的多模态多智能体框架,核心是 “双 RAG 检索流水线 + 五阶段智能体协作” 架构 —— 两条并行的 RAG 流水线分别处理文本和视觉信息,再由规划、执行、判验、溯源等专属智能体,对多模态的检索结果进行融合推理,最终输出结构化内容;在 DocVQA、ChartQA 等权威基准上,该方案的综合表现均显著优于单模型解析方案。

  • 《MACT: Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling for Visual Document Understanding》(CVPR 2026):提出了一种多智能体协同的文档解析框架,核心是将解析任务映射为四个串行协作的专业智能体(规划、执行、判验、输出),并设计了一种 “自适应推理时缩放” 技术 —— 根据文档的布局复杂度,动态调整视觉编码器的分辨率,在保障精度的同时,降低了无效计算和部署成本。

  • 《Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research》(alphaXiv 2025):华为提出的工业级落地框架,将多模态文档解析技术与智能体的迭代式检索能力深度融合,通过多轮的跨文档智能体检索,将解析、检索与跨文档推理环节串联在一起,实现了多文档间的关联分析;在自研的 M4DocBench 多文档评测基准中,该方案的跨文档信息抽取准确率显著优于现有行业方案。

  • 《Agentic Document Extraction: A Visual AI-First Approach》(LandingAI 2025):系统阐述了智能体驱动解析的技术理念,详细描述了按需解析的实现路径;文中指出,智能体的核心价值在于,将 “文档布局理解” 与 “业务目标理解” 两大环节串联,真正实现了基于业务需求的文档内容精准提取;其公开的 ADE API 接口方案,已成为行业内的主流落地参考标准。

4.2 代表性开源项目与商业落地方案

与技术综述类文章的理论视角不同,开源项目与商业方案更贴近真实场景的工程化落地需求 —— 学术论文的技术突破,通过这类项目转化为实际可落地的处理能力,也更直观地反映出技术在真实场景中的适配效果。

4.2.1 开源项目

开源项目是行业技术落地的核心支撑,不同类型项目间的组合适配,覆盖了绝大多数企业级场景的技术需求:

  • MinerU:由上海人工智能实验室 OpenDataLab 团队开发,是目前行业内认可度最高的开源解析工具,适配学术论文、财报等复杂文档场景。其核心架构为 decoupled 视觉 - 语言双编码器,对多栏排版、公式、跨页表格等元素做了专项优化,可将 PDF、图片等格式文档直接转换为标准化的 Markdown 或 JSON 格式,完整保留文档中的布局、表格、公式、图表信息;支持本地离线部署,可通过 API/SDK 快速接入下游业务系统。截至 2026 年 8 月,该项目在 GitHub 上星标数量已突破 81K,是文档解析领域的主流开源选择。

  • Docling:由 IBM 开发的轻量化开源解析工具,专为大模型 RAG 场景设计,支持 PDF、DOCX、PPTX、HTML 等多格式文档输入。其核心技术是 “布局感知注意力机制”,可以精准还原文档的层次结构、阅读顺序和表格内容;输出格式为标准的 Markdown 或 JSON,天然适配下游 RAG、知识库构建等业务场景;支持自定义扩展插件,可根据业务需求添加专用解析组件。

  • PaddleOCR:百度开源的成熟 OCR 引擎,具备多语种支持、训练成本低、部署方式灵活等优势。除了基础的文字识别能力外,还配套了完整的文档解析工具链 —— 版面分析工具 PPStructure、表格识别工具 TableStrucrue、公式识别工具 UniMERNet 等;在标准商务文档、简单扫描件等场景下表现稳健,是混合架构方案中的核心补充组件。

  • Nougat:Meta 开发的学术专用解析工具,是学术论文场景的主流开源选择。它基于 Transformer 架构设计,专门针对学术论文的多栏排版、公式、表格、参考文献做了专项优化,能将学术 PDF 文档转换为兼容 Mathpix Markdown 标准的格式,完整保留文档中的复杂公式、表格布局与参考文献格式;支持批量处理与 API 调用,适配学术场景的大规模文献处理需求。

  • Marker:开源的学术文档解析工具,由 Vik Paruchuri 开发,专注于科学文献、技术手册这类公式 / 代码密集型文档的高精度格式转换。它对学术论文的多栏排版、公式、图表关联逻辑做了专项优化,可直接将 PDF 文档转换为适配 LLM 知识库的 Markdown 格式;核心优势在于对阅读顺序的精准识别,尤其适配需要将解析结果导入学术知识库的场景。

  • ColPali:开源的多模态检索方案,其技术核心是 “文档图像直接嵌入” 的逻辑 —— 将文档的视觉特征、布局特征与少量 OCR 文本特征融合,生成多模态向量,完全绕开了 “OCR 提取文本再做检索” 的传统链路。在保留了 VLM 布局结构理解优势的同时,保障了检索性能;适合作为混合解析架构中的补充组件,优先适配多模态文档的检索类场景。

  • OvisOCR2:阿里巴巴开源 0.8B 超轻量化 OCR-Free 文档解析模型,面向边缘与私有化部署,整页端到端解析,在 OmniDocBench 多项指标领先。

  • HunyuanOCR(HyOCR):腾讯开源 1B 端到端文档解析模型,支持多语种、手写体识别,配套完整推理部署工具链,适配扫描文档场景。

  • Youtu-Parsing:腾讯优图开源并行解码解析框架,重点优化表格识别速度,支持印章、手写内容提取。

  • HPD-Parsing:百度飞桨开源层级并行解析方案,深度整合 PaddleOCR 生态,适合构建混合流水线架构,高吞吐批量文档处理场景。

4.2.2 商业落地方案

商业方案主要覆盖开源方案无法满足的中高端企业级场景,核心优势在于端到端的稳定性、全链路的安全保障以及贴身的技术服务支持:

  • 阿里云智能文档处理(IDP) :阿里云推出的企业级解析服务,核心采用 “轻量化 VLM + 混合编排” 架构。支持 PDF、Word、Excel、扫描件等多格式文档输入,融合了多模态、OCR、智能体编排等多项技术,可精准提取文档中的文字、表格、公式内容;提供公有云、专有云、离线私有化等多种部署方案,适配金融、制造等行业的高安全等级要求。

  • 腾讯云智能体开发平台:腾讯云推出的 “解析 + 业务” 一站式处理平台,核心采用多智能体协同架构,融合了多模态解析、OCR、RAG 等技术。支持用户上传文档后,由智能体根据文档类型、业务精度要求,动态选择轻量化 VLM 或传统 OCR 工具进行解析,再将提取结果直接注入下游知识库、RAG、自动化业务系统中;提供企业级的高并发支撑、安全隔离、数据溯源能力。

  • 华为云智能文档处理:华为云推出的企业级解析服务,核心技术来自于其 Doc-Researcher 系统的工业化沉淀。采用轻量化解析专用 VLM,对复杂表格和文档布局有很好的理解能力;支持多格式文档的高精度解析,输出标准化的 Markdown 或 JSON 格式,可直接对接下游 RAG、知识库、业务自动化系统;支持全链路离线私有化部署,适配有强合规要求的行业。

  • Amazon Textract:AWS 推出的企业级解析服务,核心采用 “轻量化 VLM + 智能体编排” 架构。在轻量化 VLM 解析的基础上,额外提供了智能体编排能力,可自动分类文档、识别关键实体、校验提取数据的准确性;与 AWS 云原生服务的无缝集成度极高,适配基于 AWS 云原生架构的企业级文档处理场景。

  • MinerU Pro:OpenDataLab 推出的 MinerU 商业增强版方案,核心技术与开源版同源,在解析精度、处理性能上做了进一步工程化优化;额外提供了智能体编排能力,可实现多文档间的关联分析、交叉校验,将解析、检索与跨文档推理环节串联在一起;配套完善的企业级技术支持服务,适配对精度有极高要求的场景。

  • TextIn ParseX:合合信息推出的企业级解析服务,基于多模态、OCR、专用表格识别等多技术混合架构。在复杂表格、公式识别场景下表现优异,能将解析后的文档输出为标准化的 Markdown 或 JSON 格式;提供公有云、私有化离线等多种部署方案,适配不同行业的高安全等级要求。

5. 总结与技术趋势展望

综合 2020-2025 年的技术发展路径与最新行业落地进展,可从技术、场景、落地三个维度总结文档解析技术的当前状态,并预判下一步发展趋势。

5.1 技术发展总结

2020-2025 年,文档解析技术完成了三次关键技术跃迁,形成了成熟的三元技术格局,其技术价值从 “单纯提升识别精度” 升级为 “支撑企业级业务流程自动化的基础核心能力”:

  • 技术架构维度:从 “传统 OCR 模块化流水线”,进化到 “多模态 VLM 端到端解析”,再升级到 “智能体驱动的认知理解”—— 实现了从 “像素抄录” 到 “结构理解” 再到 “业务认知” 的技术飞越。其中,轻量化解析专用 VLM 是行业技术落地方案的核心选择,而智能体架构成为串联所有技术环节、实现解析结果业务价值的关键引擎。2026 年国内多家厂商陆续开源 OvisOCR2、HPD-Parsing、Youtu-Parsing、HunyuanOCR 进一步丰富轻量化模型生态,补齐边缘部署、高吞吐场景的技术缺口。

  • 场景适配维度:技术选型的 “场景边界化” 成为行业共识。学术论文场景的最优方案是轻量化解析专用 VLM;通用文档场景下,混合架构是企业级生产环境的主流选择;智能体架构则覆盖了开源方案无法满足的中高端企业级复杂文档处理场景。

  • 工程化落地维度:解析能力不再是独立的 “技术模块”,而是与下游 RAG、知识库构建、业务自动化等场景深度融合 —— 从 “提取文字” 升级为 “提取高质量业务元数据”,并通过标准化接口与下游业务系统打通,成为支撑多类业务系统的底层基础能力;同时,行业级的混合架构方案已完全成熟,在精度、成本、部署合规性上实现了较好的平衡。

5.2 现存技术短板

整个文档解析行业的技术成熟度已达到较高水平,但仍存在部分技术短板,是行业下一步的重点攻坚方向:

  • 超大文档处理效率瓶颈:对于 500 页以上的超长篇幅文档、分辨率异常高的扫描件,主流轻量化 VLM 方案的解析耗时较长,难以满足高并发场景的实时性要求;目前仅能通过多切片并行处理的方式缓解,但会增加开发成本,且存在内容截断、解析精度下降风险。

  • 高复杂度元素识别精度不足:对文档中模糊的手绘草图、复杂公式套嵌、低质量扫描件的解析精度仍有波动,OCR 错误率、表格结构识别错误率较高;无法达到金融、医疗行业的核心业务数据精度标准。

  • 多文档关联能力薄弱:当前技术方案的能力边界大多停留在单文档处理环节,跨文档的内容关联、逻辑校验的能力,仍严重依赖下游的 RAG 或智能体业务组件支撑;解析环节本身无法在多文档间建立布局级的关联,也无法主动校验多文档间的逻辑一致性。

  • 智能体架构工程化不完善:智能体驱动解析的技术逻辑完全成熟,但调度逻辑、工具选择、多智能体交互的工程化落地复杂度高,缺乏行业级标准化框架;不同厂商方案的智能体交互逻辑完全不同,落地成本高昂,需要较强的配套工程研发能力支撑。

  • 重资源依赖问题突出:轻量化 VLM 方案仍对 GPU 资源有一定要求,在资源受限的端侧设备上,推理速度难以满足实时性要求;部分轻量化方案在端侧部署时,精度会出现明显衰减,无法平衡精度与部署成本。

5.3 技术趋势展望

综合学术研究进展与头部厂商的技术沉淀,未来 2-3 年,文档解析技术将沿着 “更智能、更高效、更贴合业务场景” 的方向持续演进,重点向以下技术方向突破:

  • 多智能体协同解析架构普及:将单文档解析任务进一步拆解,由版面分析、文字识别、表格提取、图表提取等专项智能体并行处理不同的内容区块,再由编排智能体统一拼接校验结果。通过多智能体的并行协同,在保证解析精度的前提下,大幅缩短超长文档的解析耗时,提升单节点并发处理能力。工程层面,目前绝大多数轻量化 VLM 仅提供单机推理脚本;大规模企业落地普遍基于 FastAPI 封装模型推理接口,结合 MQ 任务队列、K8s 实现分布式弹性扩缩容。但缺少原生分布式调度规范;未来行业会形成标准化的解析微服务封装范式,结合智能体动态路由实现 “算力按需调度、模型按需加载”。

  • 轻量化 VLM 的端侧优化:通过模型蒸馏、量化、分辨率动态调整等技术手段,压缩轻量化 VLM 的参数规模,降低推理资源开销,实现端侧设备上的高精度、低延迟解析;依托 OvisOCR2、HunyuanOCR 等小参数量模型,重点发展端侧多模态技术,在保障精度的同时,让模型适配国产信创算力环境,支持私有化部署。

  • 解析环节的多模态溯源能力强化:将解析后的文本、表格、图表数据,与原始文档的页码、像素坐标、区域的布局特征绑定,在提取的结构化数据和原始文档位置之间建立完整的溯源链路;支持反向定位复核,满足金融、政务等行业的高合规性要求。

  • 多模态文档的统一表示技术成熟:融合文字、版面、图表、公式信息生成多模态文档表示,将解析、检索与跨文档推理环节串联在一起;解析环节不再只输出纯文本的结构化结果,而是同时输出包含完整布局视觉、文本、布局特征的多模态向量表征,直接支撑跨文档的关联检索、多文档场景下的勾稽关系校验。MinerU-Popo 代表了该方向重要探索,打通单页解析走向全文全局一致性处理。

  • 与生成式业务场景的深度融合:解析模块不再作为独立上游模块孤立存在,而是作为智能体的核心感知环节,直接对接下游业务逻辑 —— 比如将解析后的表格数据,自动导入业务系统中进行分析校验,或自动生成对应的业务报告;由 “信息提取工具” 升级为 “业务元数据生成工具”,打通从文档解析到业务落地的全链路。


参考文献说明

本报告的技术内容、分析结论与选型建议,均基于 2020-2025 年的行业公开技术标准、顶会论文、头部开源项目、主流商业方案的公开技术文档、实测数据,以及行业内的权威技术调研分析报告整理而成。

为保障技术内容的准确性与可追溯性,本报告的核心技术观点、实测数据、场景结论均标注了权威来源引用,覆盖以下三类核心来源类型:

  • 顶会论文:包括 ACL、CVPR、ICLR、AAAI、arXiv 等主方向文档,以及文档解析领域的专项技术 workshop 论文;

  • 头部行业报告:包括技术咨询机构、头部云厂商、头部开源项目发布的行业技术白皮书、实测基准报告;

  • 主流开源 / 商业项目公开文档:包括核心技术文档、官方实测性能基准、版本更新日志、官方场景落地案例、公开技术交流内容等。

所有技术细节、实测数据、场景适配结论均可在对应引用的来源中,查阅到详细的支撑性资料。


免责声明

本报告基于公开可获取的学术论文、行业报告、技术文档及厂商公开资料进行整理分析,不代表任何厂商的商业立场,未因提及特定产品、项目、技术方案而获得任何形式的利益。行业内技术方案的迭代速度较快,报告内容仅覆盖截至 2026 年 8 月的公开技术内容,不保证所有信息的绝对时效性。

技术方案的选型需要综合考虑业务文档集合特点、下游业务精度要求、部署环境约束、行业合规标准、长期技术迭代成本等多维度因素,不存在适配所有场景的 “银弹” 方案 —— 本报告的技术结论、选型建议仅供行业技术参考,不构成任何商业落地的技术依据。

在实际项目落地中,建议根据实际业务场景,搭建专属的文档解析技术评测基准,对候选方案的精度、性能、部署成本、合规性进行严格验证,再确定最终技术方案。

参考资料

  1. 最新百度PaddleOCR开源HPD-Parsing,提出层级并行文档解析,1B模型解码步数最高压缩18倍,文档解析效率提升3倍!-CSDN博客

  2. 百度打造的文档解析"流水线工厂":让AI读懂一页文档的每个角落|百度飞桨|Hugging Face|生产线|系统|打字员_手机新浪网

  3. P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling

  4. 一文读懂HPD-Parsing架构:InternVL3.5-1B backbone与P-MTP预测技术深度解析-CSDN博客

  5. HPD-Parsing: Hierarchical Parallel Document Parsing-CSDN博客

  6. [[Feat] Support HPD-Parsing #18262](https://github.com/PaddlePaddle/PaddleOCR/pull/18262/files/69b9f50648d5ed195887c022e0cb456c8a33eed4)

  7. 百度飞桨开源 HPD-Parsing:高吞吐层级并行文档解析技术 | 每日 AI 资讯

  8. HPD-Parsing: Hierarchical Parallel Document Parsing

  9. OvisOCR2 Technical Report

  10. 阿里巴巴造出0.8B超小文档解析神器,端到端解析时代来了?_新浪财经

  11. OvisOCR2: A 0.8B Model Parses Whole Pages in One Pass

  12. OvisOCR2:0.8B 端到端文档解析模型解读 - CCTest

  13. OvisOCR2 Technical Report-CSDN博客

  14. OvisOCR2 技术报告 | alphaXiv

  15. OvisOCR2 技术报告发布:0.8B 端到端文档解析模型登顶 OmniDocBench

  16. OvisOCR2 — 0.8B Alibaba model tops OmniDocBench and beats pipeline OCR

  17. MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

  18. MinerU-Popo来了:让文档解析从“看懂每页”走向“读懂整篇”近年来,以 MinerU 为代表的智能文档解析系统, - 掘金

  19. [[Literature Review] MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing](https://www.themoonlight.io/en/review/mineru-popo-universal-post-processing-model-for-structured-document-parsing)

  20. [[论文评述] MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing](https://www.themoonlight.io/zh/review/mineru-popo-universal-post-processing-model-for-structured-document-parsing)

  21. MinerU + RAG 集成实战:从 PDF 结构化解析到精准检索MinerU + RAG 集成实战:从 PDF 结构 - 掘金

  22. MinerU | 面向 Agent 和 RAG 的智能文档解析平台

  23. 【MinerU 技术解析】高精度文档解析引擎的架构原理与工程实践-CSDN博客

  24. MinerU的正确使用方式:如何解析PDF成标准化向量数据,以供AI大模型等场景应用_pdf大模型解析 上海人工智能实验室 mineru-CSDN博客

  25. GLM-OCR Technical Report

  26. Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding

  27. GLM-OCR效果展示:复杂三栏学术论文→分栏识别→参考文献独立结构化-CSDN博客

  28. 腾讯优图Youtu-Parsing开源,无损并行解码让表格解析提速26倍,OmniDocBench 93.22分 - 技术栈

  29. GLM-OCR - 智谱AI开源专业OCR模型,0.9B参数登顶SOTA榜单 | AI产品库官网 - AIProductHub

  30. 告别混乱OCR!Youtu-Parsing全要素解析实测:文本、表格、公式一个不漏-CSDN博客

  31. GLM-OCR Technical Report - 智源社区论文

  32. Youtu-Parsing效果实测:精准识别手写体、印章,解析速度提升5-11倍-尧图企业网站定制

  33. PDF转markdown,AI知识库绝配,科研文献整理必备 这是一个开源免费的PDF解析神器-MinerU。他可以把PDF转换成可以编辑的Markdown格式,其中的图片,表格,数学公式等都可以精准提

  34. 面试官问:企业级RAG怎么处理PDF? MinerU+Unstructured混用才是企业级答案,Unstructured做通用ETL归一化,通吃25+种格式;MinerU攻坚中文复杂文档,92%转换

  35. HPD-Parsing: Hierarchical Parallel Document Parsing

  36. [MinerU:帮 AI 快速解析文档。做 RAG、知识库、Agent 应用时,我们会遇到文档没法稳定变成机器可读的数据。MinerU 就是来处理这件事的。

它可以把 PDF、图片、Word、PPT、](https://www.iesdouyin.com/share/video/7670808207404616975)

  1. OvisOCR2 Technical Report

  2. OvisOCR2 Technical Report-CSDN博客

  3. MinerU与PyMuPDF对比评测:复杂排版提取精度与速度实战分析-CSDN博客

  4. MinerU实战案例:学术论文PDF批量转Markdown完整指南-CSDN博客

  5. Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding

  6. GLM-OCR效果展示:复杂三栏学术论文→分栏识别→参考文献独立结构化-CSDN博客

  7. 2026 Complete Guide: How to Use GLM-OCR for Next-Gen Document Understanding

  8. GLM-OCR - 智谱AI开源专业OCR模型,0.9B参数登顶SOTA榜单 | AI产品库官网 - AIProductHub

  9. PDF Parsing for AI Agents: liteparse vs GLM-OCR vs LlamaParse

  10. GLM-OCR Technical Report

  11. 用GLM-OCR搭建本地文档处理工具:发票/合同/证件信息一键抽取-CSDN博客

  12. GLM-OCR

  13. Youtu-Parsing科研AI助理:文献PDF解析+核心公式LaTeX+实验图表+结论摘要结构化-CSDN博客

  14. 多模态文档解析 - 大模型看懂图表印章手写与复杂版面的技术方案 | TextIn

  15. Docflow - AI-Powered Document Summarizer + QNA

  16. PDF解析:3类复杂文档,字段精准抽取+导入数据库 演示内容包括:版面分析与表格识别、识别结果与原文同步定位溯源、双Agent大模型智能字段抽取、抽取结果一键导出MySQL数据库。从PDF上传到数据落库,全流程无需手动干预。适用于财务、科研、标准化等多种业务场景。 #OCR #PDF解析 #智能抽取 #MySQL #企业级文档处理

  17. 阿里开源Logics-Parsing:让复杂文档解析从此“一键结构化”_AI码韵匠道

  18. PaddleOCR-VL-WEB实战解析|紧凑VLM架构实现高精度文档理解-CSDN博客

  19. FastGPT大文件解析终极指南:轻松处理GB级PDF文档-CSDN博客

  20. 十亿级参数,千亿级性能,上海AI Lab发布新一代文档解析大模型,复杂场景解析精度媲美人类专家

  21. Document RAG

  22. 万字详解大模型应用发展:RAG、MCP、Agent的爆发之旅-CSDN博客

  23. 多模态RAG与Agentic RAG架构前沿:从失效边界到未来演进 - i开源架构

  24. Document Understanding

  25. 数据知识化:迈出“构建以AI为中心”工作流的第一步 - fabarta

  26. 多模态大模型学习笔记(三十九)——生成式与Transformer式OCR:从“像素抄录“到“文档智能“的完整演进_crnn 英文模型-CSDN博客

  27. Lessons from a Decade of Document AI Work

  28. Document Question Answering Models

  29. 2026年RAG系统主流开源文档解析工具选型指南:PaddleOCR、MinerU、LiteParse、HunyuanOCR、Apache Tika 全面对比 - 技术栈

  30. MinerU vs PaddleOCR对比评测:云端GPU 2小时完成选型-CSDN博客

  31. OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations

  32. 专用文档解析工具推荐(2026 年最新)_mineru 化工材料-CSDN博客

  33. MinerU vs Docling vs Marker:开源文档解析工具深度对比MinerU vs Docling vs - 掘金

  34. Best Document Parsing Tools in 2026

  35. Document AI: A Comparative Study of Transformer-Based, Graph-Based Models, and Convolutional Neural Networks For Document Layout Analysis

  36. OCR & Document Parsing.

  37. Unlimited OCR 论文精读:R-SWA 如何实现一次性长文档解析-CSDN博客

  38. Hy AI Studio

  39. HyOCR-1.5 深度解读:1B 参数霸榜 OmniDocBench,端到端 OCR 的全栈开源里程碑-CSDN博客

  40. 1B 干翻 7B,94 分霸榜:腾讯混元 OCR 全栈开源,老李的 A100 可以卖了-腾讯云开发者社区-腾讯云

  41. HunyuanOCR能否识别手写体?实测中文手写笔记准确率-CSDN博客

  42. 腾讯混元HunyuanOCR-1.5,1B小模型,6.37倍加速,331种语言,同时做到最快推理和最广OCR能力-CSDN博客

  43. 腾讯混元发布并开源端到端 OCR 大模型(HyOCR / HunyuanOCR)_互联网_艾瑞网

  44. 混元OCR:混元原生多模态端到端 OCR 专家,1B 轻量化参数却斩获多项业界 SOTA!

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐