跳到正文
MinerU:把 PDF、扫描件和 Office 文档拆成可用的 Markdown

MinerU:把 PDF、扫描件和 Office 文档拆成可用的 Markdown

开源的高精度文档解析工具。专门针对复杂多栏排版、数学公式、表格与图表混排进行深度提取,将杂乱的 PDF 转化为结构纯净的 Markdown。

MinerU:把 PDF、扫描件和 Office 文档拆成可用的 Markdown

状态:日常主力 · 适合复杂 PDF 解析、学术论文排版提取与知识库前置清洗

速读#

在构建知识库或喂入 LLM 时,PDF 文件是最棘手的格式:双栏排版、页眉页脚干扰、跨页表格断裂、复杂数学公式变成乱码图片。

MinerU(OpenDataLab 出品)专门攻克这一难关:通过版面分析模型(LayoutLM)、表格重建与公式识别,将最复杂的学术论文与财报 PDF 转换为排版清晰的纯净 Markdown。

最短上手与 CLI 命令#

Terminal window
# 本地 GPU / CPU 环境下执行转换
magic-pdf -p my_paper.pdf -o ./output_dir -m auto

转换后的 output_dir 会生成包含完整 LaTeX 公式、Markdown 表格以及单独抽离出的高清插图目录。

正确的使用顺序#

  1. 优先在官方网页端上传 1 份典型文档验证识别精度。
  2. 涉及大量私密文件时,在本地或内网 GPU 服务器部署 CLI 批量转换。
  3. 转换后的 Markdown 经过人工抽检后,再统一导入 karpathy-llm-wiki 或知识库向量库。

不适合什么情况#

  • 纯文本 TXT 或已有源码的简单文档(直接读取即可,无需启动重型版面模型)。
  • 无 GPU 的极低配机器处理数百页巨型扫描件(本地 CPU 转换耗时较长)。

文档解析是知识库质量的地基。输入给模型的原料越干净,后续推理的幻觉越少。

s1oopX

登录 s1oopX