状态:推荐使用 · 适合文档转 Markdown、知识库入库和资料抽取
速读#
MinerU 面向的不是简单复制 PDF 文本,而是尽量恢复文档结构。它支持 PDF、图片、DOCX、PPTX 和 XLSX 输入,可以按人类阅读顺序输出 Markdown、JSON 和中间结构;公式转成 LaTeX,表格转成 HTML,并自动处理页眉页脚、多栏布局、扫描件和乱码 PDF。
这类能力对知识库、RAG、论文整理和批量资料归档很关键。普通 PDF 提取器常把双栏论文左右穿插、把表格拆成一串字符、把公式变成乱码。MinerU 的价值是先把版面理解这层做掉,让后续搜索、切分和模型处理拿到更像文档而不是坐标碎片的内容。
它适合解决什么#
| 输入难点 | MinerU 的处理 | 适合的下游 |
|---|---|---|
| 多栏和复杂版式 | 重建阅读顺序、移除页眉页脚 | Markdown 阅读、分段切块 |
| 扫描件和图片 | 自动启用 OCR,支持 109 种语言 | 档案数字化、全文搜索 |
| 数学公式 | 识别并转换为 LaTeX | 论文、教材、技术资料 |
| 表格 | 识别结构并转换为 HTML | 数据抽取、人工复核 |
| 混合文档 | 提取正文、图片、标题、脚注等 | 知识库和多模态流程 |
使用方式也比较完整:在线服务和桌面客户端适合单份处理,CLI、FastAPI、Docker 和 SDK 适合批量流水线,MCP Server 则可以把文档解析能力接到 Cursor、Claude Desktop、Windsurf 等工具中。
正确的使用顺序#
- 先用几份最难的真实文档做样本,不拿排版干净的宣传 PDF 自我安慰。
- 同时检查正文顺序、表格、公式、脚注和图片归属。
- 根据任务选择 Markdown 或 JSON,不要所有下游都硬吃同一种输出。
- 批量处理前保留原文件、解析日志和工具版本,方便追溯。
- 对关键资料建立抽检,尤其是数字、单位、公式和跨页表格。
文档解析不存在「成功退出就百分之百正确」。OCR 可能认错数字,表格可能合并错单元格,复杂图文关系也可能丢失。MinerU 能显著降低人工整理量,但不能替代最终校对。
本地、在线与授权边界#
敏感材料优先本地部署,在线体验更适合公开或低敏感文件。即使本地运行,模型下载、CPU/GPU 占用和大文件批处理时间也要提前评估;桌面版方便,不代表所有机器都能快速处理复杂长文档。
项目当前使用单独的 MinerU License,它以 Apache 2.0 为基础,但不能简单写成标准 Apache-2.0。把它集成进商业产品、重新分发或提供服务前,应直接阅读仓库当前 LICENSE,不要沿用旧文章里的许可结论。
不适合什么情况#
- 只要提取可搜索纯文本,系统 OCR 或简单工具已经够用。
- 需要法律、财务或科研级零误差,却没有人工复核流程。
- 文档高度依赖复杂图表语义,希望一次转换就得到完美知识图谱。
- 无法接受本地算力成本,也不能把文件上传到在线服务。
MinerU 最值得推荐的地方,是把「看得见页面」推进到「拿得到结构」。但结构化结果只是更好的原料,不是已经验证过的事实。
