跳到正文
MinerU:把 PDF、扫描件和 Office 文档拆成可用的 Markdown

MinerU:把 PDF、扫描件和 Office 文档拆成可用的 Markdown

MinerU 能解析 PDF、图片、DOCX、PPTX 和 XLSX,按阅读顺序输出 Markdown、JSON 等结构化结果,并处理公式、表格和 109 种语言 OCR。它适合知识库与资料整理,但解析结果仍需人工抽检。

MinerU:把 PDF、扫描件和 Office 文档拆成可用的 Markdown

状态:推荐使用 · 适合文档转 Markdown、知识库入库和资料抽取

速读#

MinerU 面向的不是简单复制 PDF 文本,而是尽量恢复文档结构。它支持 PDF、图片、DOCX、PPTX 和 XLSX 输入,可以按人类阅读顺序输出 Markdown、JSON 和中间结构;公式转成 LaTeX,表格转成 HTML,并自动处理页眉页脚、多栏布局、扫描件和乱码 PDF。

这类能力对知识库、RAG、论文整理和批量资料归档很关键。普通 PDF 提取器常把双栏论文左右穿插、把表格拆成一串字符、把公式变成乱码。MinerU 的价值是先把版面理解这层做掉,让后续搜索、切分和模型处理拿到更像文档而不是坐标碎片的内容。

它适合解决什么#

输入难点MinerU 的处理适合的下游
多栏和复杂版式重建阅读顺序、移除页眉页脚Markdown 阅读、分段切块
扫描件和图片自动启用 OCR,支持 109 种语言档案数字化、全文搜索
数学公式识别并转换为 LaTeX论文、教材、技术资料
表格识别结构并转换为 HTML数据抽取、人工复核
混合文档提取正文、图片、标题、脚注等知识库和多模态流程

使用方式也比较完整:在线服务和桌面客户端适合单份处理,CLI、FastAPI、Docker 和 SDK 适合批量流水线,MCP Server 则可以把文档解析能力接到 Cursor、Claude Desktop、Windsurf 等工具中。

正确的使用顺序#

  1. 先用几份最难的真实文档做样本,不拿排版干净的宣传 PDF 自我安慰。
  2. 同时检查正文顺序、表格、公式、脚注和图片归属。
  3. 根据任务选择 Markdown 或 JSON,不要所有下游都硬吃同一种输出。
  4. 批量处理前保留原文件、解析日志和工具版本,方便追溯。
  5. 对关键资料建立抽检,尤其是数字、单位、公式和跨页表格。

文档解析不存在「成功退出就百分之百正确」。OCR 可能认错数字,表格可能合并错单元格,复杂图文关系也可能丢失。MinerU 能显著降低人工整理量,但不能替代最终校对。

本地、在线与授权边界#

敏感材料优先本地部署,在线体验更适合公开或低敏感文件。即使本地运行,模型下载、CPU/GPU 占用和大文件批处理时间也要提前评估;桌面版方便,不代表所有机器都能快速处理复杂长文档。

项目当前使用单独的 MinerU License,它以 Apache 2.0 为基础,但不能简单写成标准 Apache-2.0。把它集成进商业产品、重新分发或提供服务前,应直接阅读仓库当前 LICENSE,不要沿用旧文章里的许可结论。

不适合什么情况#

  • 只要提取可搜索纯文本,系统 OCR 或简单工具已经够用。
  • 需要法律、财务或科研级零误差,却没有人工复核流程。
  • 文档高度依赖复杂图表语义,希望一次转换就得到完美知识图谱。
  • 无法接受本地算力成本,也不能把文件上传到在线服务。

MinerU 最值得推荐的地方,是把「看得见页面」推进到「拿得到结构」。但结构化结果只是更好的原料,不是已经验证过的事实。

s1oopX

登录 s1oopX