PDF、Word、HTML、Markdown、图片等文档解析工具MinerU和Docling
文章目录一多种文档解析意义二文档解析工具-MinerU2.1MinerU定位2.2 MinerU能干什么2.3 安装步骤2.3.2 CIL安装2.3 基本用法2.4 三种解析方式2.5 后端选择2.6 输出结果三文档解析工具-Docling3.1 Docling 定位3.2 Docling 能干什么3.3 安装步骤3.3.1 CLI 安装3.4 基本用法3.4.1 CLI 用法3.4.2 Python 用法3.5 PDF 解析配置3.6 输出结果3.7 文档分块3.7.1 HierarchicalChunker3.7.2 HybridChunker3.8 RAG 中的使用流程一多种文档解析意义我们需要把PDF、Word、HTML、Markdown、图片等不同文档解析成干净便于向量检索的文档。二文档解析工具-MinerU2.1MinerU定位MinerU 是一个文档解析引擎主要作用是把人类阅读的文档转换成机器容易处理的 Markdown、JSON 和图片。2.2 MinerU能干什么当前本地 CLI 文档明确列出的输入包括 PDF、图片、DOCX、PPTX、XLSX。2.3 安装步骤2.3.2 CIL安装# 创建虚拟环境uv venv .venv# 激活环境.venv\Scripts\Activate.ps1# 安装基础功能uv pipinstallmineru[core]# 检查安装mineru--versionmineru--help完整功能或源码开发可以使用gitclone https://github.com/opendatalab/MinerU.git Set-Location MinerU uv pipinstall-e.[all]2.3 基本用法纯 CPU 环境建议先使用 pipelinemineru-p.\samples\document.pdf-o.\output-bpipeline-mauto-lch参数含义参数作用-p输入文件或目录-o输出目录-b选择解析后端-m选择文字提取方式-lOCR 文档语言-s、-e指定开始页和结束页-t是否解析表格-f是否解析公式2.4 三种解析方式模式适用情况auto自动判断日常默认使用txtPDF 有完整且正常的文字层ocr扫描 PDF、图片 PDF、乱码 PDF示例# 自动判断mineru-pinput.pdf-ooutput-bpipeline-mauto# 强制直接提取文字mineru-pinput.pdf-ooutput-bpipeline-mtxt# 强制 OCRmineru-pinput.pdf-ooutput-bpipeline-mocr-lch2.5 后端选择后端特点建议pipeline传统解析流水线支持纯 CPU入门首选vlm-engine使用视觉语言模型复杂图文需要较多资源hybrid-engine结合多种解析能力GPU 环境和复杂文档vlm-http-client调用外部 VLM 服务服务化部署hybrid-http-client调用外部混合服务服务化部署当前版本的默认后端可能随版本变化因此以本机 mineru --help 为准。没有 GPU 时明确指定-bpipeline2.6 输出结果不同版本的具体文件名可能不同但主要有Markdown适合查看内容也可以用于简单分块。content list JSON按照阅读顺序保存标题、正文、表格、图片等元素最适合后续构建 RAG。middle JSON包含更详细的中间解析和版面信息适合排查问题。images从文档中提取的图片。可视化结果用于检查版面框和元素识别是否正确。RAG 中建议以 content list JSON 为主因为它比单纯 Markdown 更容易保留页码、类型和位置信息。三文档解析工具-Docling3.1 Docling 定位Docling 是一个多格式文档解析、转换和分块框架。它会把不同格式的文件统一转换成结构化的DoclingDocument。DoclingDocument可以继续导出为 Markdown、JSON、HTML或者直接进行 RAG 分块。Docling 支持完全本地运行文档不需要上传到云端。3.2 Docling 能干什么Docling 支持的主要输入格式包括 PDF、DOCX、PPTX、XLSX、HTML、Markdown、图片、EPUB、LaTeX、纯文本、邮件和部分音频格式。Docling 可以识别和保留以下内容内容解析结果标题保留标题及层级正文提取段落和阅读顺序列表保留列表结构表格识别行、列和单元格图片提取图片和图片标题扫描文字通过 OCR 识别公式和代码保留对应内容类型元数据保存来源、页码和位置信息3.3 安装步骤3.3.1 CLI 安装# 创建虚拟环境uv venv.venv# 激活虚拟环境.venv\Scripts\Activate.ps1# 安装 Doclinguv pip install docling# 检查安装docling--version docling--help使用 HuggingFace tokenizer 进行 RAG 分块时可以安装uv pip installdocling-core[chunking]3.4 基本用法3.4.1 CLI 用法转换成 Markdowndocling.\samples\document.pdf--to md--output.\output转换成 JSONdocling.\samples\document.pdf--to json--output.\output--to用于指定输出格式--output用于指定输出目录。3.4.2 Python 用法fromdocling.document_converterimportDocumentConverter converterDocumentConverter()resultconverter.convert(./samples/document.pdf)docresult.document markdowndoc.export_to_markdown()datadoc.export_to_dict()htmldoc.export_to_html()result.document是统一的DoclingDocument。后续导出、遍历元素和分块都基于这个对象进行。3.5 PDF 解析配置包含扫描页面和表格的 PDF可以启用 OCR 和表格结构识别fromdocling.datamodel.base_modelsimportInputFormatfromdocling.datamodel.pipeline_optionsimportPdfPipelineOptionsfromdocling.document_converterimportDocumentConverter,PdfFormatOption optionsPdfPipelineOptions(do_ocrTrue,do_table_structureTrue,)converterDocumentConverter(format_options{InputFormat.PDF:PdfFormatOption(pipeline_optionsoptions)})resultconverter.convert(./samples/document.pdf)docresult.document常用配置参数作用do_ocr对扫描页面和图片文字执行 OCRdo_table_structure识别表格行列和单元格结构generate_page_images生成完整页面图片generate_picture_images提取文档中的图片区域images_scale控制生成图片的清晰度do_picture_description使用视觉模型生成图片描述提取文档中的图片options.generate_picture_imagesTrueoptions.images_scale2.03.6 输出结果Docling 主要支持以下输出输出作用Markdown人工查看、结果校验和简单处理JSON保存完整的DoclingDocument结构HTML在网页中展示解析结果DocTagsDocling 使用的结构化标记格式DoclingDocument用于程序处理和 RAG 分块markdowndoc.export_to_markdown()json_datadoc.export_to_dict()htmldoc.export_to_html()doctagsdoc.export_to_doctags()RAG 项目建议直接使用DoclingDocument进行分块不需要先导出 Markdown 再重新解析。3.7 文档分块3.7.1 HierarchicalChunkerHierarchicalChunker根据标题、段落、列表、表格等文档结构进行分块。fromdocling.chunkingimportHierarchicalChunker chunkerHierarchicalChunker()chunkslist(chunker.chunk(doc))forchunkinchunks:print(chunk.text)3.7.2 HybridChunkerHybridChunker先按照文档结构分块再根据 tokenizer 控制 chunk 长度。超长内容会被拆分相邻且较短的同级内容可以合并。fromdocling.chunkingimportHybridChunkerfromdocling_core.transforms.chunker.tokenizer.huggingfaceimport(HuggingFaceTokenizer,)tokenizerHuggingFaceTokenizer.from_pretrained(model_nameBAAI/bge-m3,max_tokens512,)chunkerHybridChunker(tokenizertokenizer,merge_peersTrue,)chunkslist(chunker.chunk(doc))forchunkinchunks:embedding_textchunker.contextualize(chunk)print(chunk.meta.headings)print(embedding_text)分块器适用情况HierarchicalChunker强调标题和文档元素结构HybridChunker同时控制结构和 token 长度适合 RAG3.8 RAG 中的使用流程PDF、Word、HTML、Markdown、图片 ↓ DocumentConverter ↓ DoclingDocument ↓ HybridChunker ↓ BGE-M3 向量化 ↓ Milvus建议向量化chunker.contextualize(chunk)的结果。入库时保存正文、标题路径、页码、来源、内容类型和文档 ID。Markdown 主要用于人工检查JSON 用于保存完整解析结果DoclingDocument和 Chunker 用于正式的 RAG 入库流程。官方资料Docling 官方文档、Docling GitHub。

相关新闻

LangChain Go应用安全实战:7大关键策略防御提示词注入与资源滥用

LangChain Go应用安全实战:7大关键策略防御提示词注入与资源滥用

1. 项目概述:为什么LangChain Go应用需要专门的安全防护?最近在几个Go语言技术社区里,看到不少朋友在讨论用LangChain框架结合Go来开发AI应用。大家聊得热火朝天,都在说怎么快速集成大模型、怎么设计Agent流程、怎么提升RAG的召回…

2026/7/28 7:36:39 阅读更多 →
Python高效处理CSV数据的实战技巧与性能优化

Python高效处理CSV数据的实战技巧与性能优化

1. CSV数据处理的核心价值与痛点在数据密集型工作场景中,CSV格式始终保持着不可替代的地位。作为数据交换的"通用语言",CSV文件以纯文本形式存储表格数据的特点,使其在数据分析、系统迁移、报表导出等场景中展现出独特的优势。我处…

2026/7/29 0:06:19 阅读更多 →
2026年AI问答代运营服务选型与优化指南

2026年AI问答代运营服务选型与优化指南

1. 项目概述:AI问答代运营服务的市场现状 2026年的企业服务市场,AI问答代运营已成为中小企业数字化转型的标配需求。根据第三方调研数据显示,采用专业AI问答服务的中小企业客户转化率平均提升37%,客服人力成本下降52%。这个领域目…

2026/7/26 14:22:38 阅读更多 →

最新新闻

Spring Cloud Config微服务配置管理核心实践

Spring Cloud Config微服务配置管理核心实践

1. Spring Cloud Config 核心价值解析 在微服务架构中,配置管理往往成为最容易被忽视却又最常引发生产事故的环节。我经历过凌晨三点被紧急呼叫处理配置错误的惨痛教训后,彻底理解了Spring Cloud Config的价值所在。这个分布式配置中心解决方案&#xff…

2026/7/30 10:37:18 阅读更多 →
SWOT、波特五力与PEST分析实战:从理论到商业决策的结构化框架

SWOT、波特五力与PEST分析实战:从理论到商业决策的结构化框架

1. 项目概述:为什么企业竞争分析不是“玄学” 在商业世界里,我们常常听到“战略”、“竞争”、“市场格局”这些词,听起来宏大又有点虚。很多创业者或者业务负责人,一提到做竞争分析,要么是凭感觉拍脑袋,要…

2026/7/30 10:37:18 阅读更多 →
OpenLayers加载WMTS服务全攻略:从原理到实战避坑指南

OpenLayers加载WMTS服务全攻略:从原理到实战避坑指南

1. 从一次地图服务对接的“翻车”说起 最近在做一个智慧园区项目,需要将不同来源的卫星影像、地形数据和业务图层整合到一张图上。客户提供了几个不同单位的WMTS服务地址,我心想这还不简单?OpenLayers作为老牌的地图库,加载个标准…

2026/7/30 10:37:18 阅读更多 →
STM32平衡车PID调参实战:从原理到参数整定全解析

STM32平衡车PID调参实战:从原理到参数整定全解析

1. 项目概述:从“立起来”到“稳得住”的最后一公里 搞过平衡车的朋友都知道,前两天的活儿——硬件焊接、基础代码框架搭建、传感器数据读取——虽然繁琐,但更多是体力活和按图索骥的流程。真正让人又爱又恨、决定项目成败的,就是…

2026/7/30 10:37:18 阅读更多 →
SpringBoot+Vue+MySQL全栈学生管理系统开发指南

SpringBoot+Vue+MySQL全栈学生管理系统开发指南

1. 项目概述:SpringBootVueMySQL全栈学生管理系统 这套学生信息管理系统采用当下主流的前后端分离架构,后端基于SpringBoot 2.x开发,前端使用Vue 3.x框架,数据库选用MySQL 8.0。作为教学级项目,它完整实现了学生信息的…

2026/7/30 10:37:18 阅读更多 →
2026年AI Agent安全危机:从GPT-5.6逃逸事件看多智能体系统的安全攻防实战

2026年AI Agent安全危机:从GPT-5.6逃逸事件看多智能体系统的安全攻防实战

2026年AI Agent安全危机:从GPT-5.6逃逸事件看多智能体系统的安全攻防实战当AI Agent学会"越狱"——一场改写AI安全规则的"斯普特尼克时刻"一、事件回顾:GPT-5.6 Sol 的"越狱"之夜2026年7月21日,一则新闻引爆了…

2026/7/30 10:36:18 阅读更多 →

日新闻

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:13 阅读更多 →
如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 你是否曾经在浏览…

2026/7/30 0:00:13 阅读更多 →
“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

更多请点击: https://intelliparadigm.com 第一章:AI 教师备课辅助 AI 教师备课辅助系统正逐步成为教育数字化转型的核心支撑工具,它并非替代教师,而是通过语义理解、知识图谱与多模态生成能力,将教师从重复性劳动中解…

2026/7/30 0:00:13 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻