MinerU 是什么、怎么用:把 PDF 等文档解析成 Markdown(4.0 的安装、四档解析与命令)

MinerU 是什么、怎么安装使用?按官方中文 README 讲清 4.0 版本的定位、支持的输入与输出格式、flash / basic / standard / advanced 四档解析各适合什么、pip 安装命令、mineru-kit 与 mineru 两个命令的分工和常用写法,以及从旧版升级要注意什么。

NNathaniel bigo··原创首发·AI 辅助撰写
8 分钟读完
资料核对于 2026-10-11 · 依据官方文档与公开资料整理 免费账号 账号
本文根据 MinerU 官方仓库的中文 README 整理,资料核对于 2026-10-11。文中命令取自官方 README,没有在本机运行验证。MinerU 更新很快,4.0 的命令和旧版差别较大,动手前先看一眼官方 README 的当前内容。

适用于谁

  • 搜「mineru 是什么」「mineru 教程」「mineru github」「mineru api」的人;
  • 要把论文、报告、扫描件这类版面复杂的文档转成 Markdown,喂给大模型或导入知识库的人;
  • 照旧教程敲命令发现对不上的人。

结论先说

  1. MinerU 是一个文档解析工具。官方现在的定位是「面向 Agent 的文档解析工具」:把本地文档转成可读的内容,并且支持按页、按块续读,保留稳定的引用位置。
  2. 输入不只是 PDF:图片、Word、PPT、Excel、EPUB、HTML 等都支持。
  3. 解析分四档:flash、basic、standard、advanced,质量依次提高,速度依次变慢,对硬件的要求也依次提高。
  4. 安装:pip install "mineru>=4.0,<5",需要 Python 3.10 及以上、3.15 以下。
  5. 两个命令:mineru-kit 做一次性的转换;mineru 面向文档库,带缓存、搜索和续读。
  6. 默认在本地处理。README 写明:默认不会自动将文档上传到官网服务,远程解析需要显式配置。

一、支持的格式

输入(README 所列):PDF、图片、DOC / DOCX、PPT / PPTX、XLS / XLSX、RTF、ODT / ODS / ODP、EPUB、OFD、HTML / MHTML、CSV / TSV。纯文本不进入解析流程。

输出:解析结果是一个统一的文档模型,可以渲染成九种目标:Markdown、HTML、LaTeX、DOCX、EPUB、PDF、Structured Content、Content List V1、Content List V2。README 注明各个命令行和 API 的导出范围不完全相同。

二、四档解析怎么选

档位质量与速度适合资源参考(README)
flash质量最低,速度最快发现、预览、建索引;不作为默认的阅读质量
basic基础质量私有的本地阅读,或资源较低的环境ONNX 模型约 0.8 GB,最低 2 GB 内存,CPU 可用
standard标准的高质量日常阅读和复杂文档ONNX 加 llama.cpp 约 2 GB,8 GB 内存,CPU 可用,推荐 Vulkan
advanced普通文档与标准档相当,困难文档更好,速度最慢能接受长时间等待的场景以官方文档为准

实际的做法:先用 flash 或 basic 把一批文档过一遍,知道里面有什么;真正要细读、要入库的,再用 standard;standard 仍然处理不好的少数困难文档,才上 advanced。

README 还提到,默认的 ONNX CPU 推理就可以运行;有 NVIDIA 显卡的可以安装 mineru[full]>=4.0。

三、安装

bash
pip install "mineru>=4.0,<5"

用 uv 的写法:

bash
uv pip install -U "mineru>=4.0,<5"

Python 版本要求是 >=3.10,<3.15。建议装在单独的虚拟环境里。

解析需要模型文件,按档位下载:

bash
mineru-kit models download --tier <tier>

把 <tier> 换成 basic、standard 等档位名。

四、两个命令的分工

命令定位
mineru-kit无状态的转换工具:给一个文件,转出结果。parse 默认处理全部页面;另外提供 webui
mineru面向文档库和智能体阅读:支持缓存、搜索,以及按页或按块续读

一次性转换(README 示例):

bash
mineru-kit parse document.pdf -o document.md --tier standard

图形界面:

bash
mineru-kit webui

README 说明这是一个 Gradio 的网页界面。

文档库式的用法(README 示例,--json 表示以 JSON 输出,方便程序和智能体读取):

bash
mineru parse document.pdf --json
mineru read "doc:ab12cd3/tier:standard/page:11" --limit 12000 --json
mineru search "liquidated damages" --min-tier basic --json
  • parse:解析并进入缓存;
  • read:按一个稳定的引用位置(哪份文档、哪一档、哪一页)读取内容,--limit 限制返回的长度;
  • search:在已解析的文档里搜索。

这套设计是为智能体准备的:长文档不必一次全部塞进上下文,智能体可以先搜索、再按页读取需要的部分,并且引用位置前后一致。

五、其他使用方式

README 提到的还有:Python SDK、V1 API、批处理、多服务的 Router、Docker。README 注明非 NVIDIA 设备的 Docker 方案仍待更新。

在线体验的入口有官网 mineru.net,以及 ModelScope、HuggingFace、Colab 上的演示。使用在线服务就意味着文档会上传,内部资料请用本地方式。

六、从旧版升级

4.0 的命令结构和 2.x、3.x 不同。README 提供了「3.x → 4.0 迁移」指南和完整的更新历史链接,升级已有的脚本前先读迁移指南。

网上大量教程是按旧版写的,命令对不上时,以 README 当前内容为准,不要照着旧命令反复试。

七、放进 RAG 流程时的注意点

  • 先抽查再批量:挑带表格、公式、双栏、扫描的样例各几份,把结果和原文对一遍;
  • 档位和成本一起考虑:几千份文档全用最高档,时间会很长。按文档类型分流;
  • 公式和表格重点核对:这是版面解析最容易出错的两类内容,关键数据不要直接采信;
  • 保留引用位置:MinerU 提供稳定的页与块引用,入库时把它存进元数据,回答时就能指回原文位置;
  • 分段与入库:见《Dify 知识库搭建教程》和《ChromaDB 是什么》。

常见问题

Q:没有显卡能用吗?

README 说明默认的 ONNX CPU 推理可用,basic 和 standard 两档都标注了 CPU 可用。速度取决于文档数量和档位。

Q:许可证是什么,能商用吗?

README 写的是「MinerU 开源许可证」,以 Apache 2.0 为基础并附加了条款。商用前请阅读许可证全文,以官方文本为准。

Q:和 Docling、MarkItDown 怎么选?

规整的电子文档先用轻量的 MarkItDown,见《MarkItDown 怎么用》;版面复杂的 PDF 在 MinerU 和 Docling 之间用自己的样例对比,见《Docling 使用教程》。没有哪一个在所有文档上都最好。

Q:模型下载很慢或失败?

README 的当前版本用 mineru-kit models download 下载模型,模型来源的设置以官方文档为准。

参考资料

  • opendatalab/MinerU(官方仓库):https://github.com/opendatalab/MinerU
  • 中文 README:https://github.com/opendatalab/MinerU/blob/master/README_zh-CN.md

Nathaniel 的更多内容

  1. 01

    promptfoo 使用教程:对比提示词和模型、写断言自动评测(安装与配置)

    promptfoo 是什么、怎么使用?按官方 README 和入门文档讲清它的用途、三种安装方式、用示例项目起步、promptfooconfig.yaml 里提示词、模型和测试用例三部分怎么写、常用断言类型的含义、eval 与 view 两条命令,以及把它放进日常改提示词流程的方法。

    ChatGPT其他 AI 工具0
  2. 02

    Kimi API怎么用:API Key获取、Python调用、K3价格与429报错处理

    Kimi API Key 在哪里获取、怎么用 Python 调用 K3、价格怎么算、429 和 401 报错怎么办?本文按 Kimi API 开放平台官方文档讲清注册认证、创建 Key、base_url 与模型名、计费规则和常见错误排查。

    Kimi0
  3. 03

    Cursor Agent 模式怎么用:Agent、Plan、Ask 三种模式,检查点回滚与消息排队

    Cursor Agent 模式是什么、和 Plan / Ask 模式怎么选?按官方文档讲清 Agent 能调用哪些工具、Shift+Tab 切换模式、Plan 模式先出方案再动手、用检查点撤销改动、任务进行中排队或插话,以及 /goal 长目标。

    Cursor0
  4. 04

    Gemini 聊天记录怎么导出:导出到文档 / 表格、生成 PDF 与用 Takeout 批量导出完整对话

    Gemini 没有「一键导出全部对话」的按钮,但有三条官方路径:单条回答导出到 Google 文档、Gmail、表格;让 Gemini 直接生成 PDF、Word、Markdown 文件;用 Google Takeout 批量下载全部活动记录。本文给出每种方法的步骤和限制。

    Gemini0
  5. 05

    ChatGPT 生成图片中文乱码、文字错误怎么办:7 个按顺序试的办法

    让 ChatGPT 做海报、封面、信息图,中文总是缺笔画、错字、乱码?本文按 OpenAI 官方图像提示指南,给出从写法、字数、局部修改、质量档位到后期排版的 7 个办法,以及什么时候干脆别让 AI 写字。

    ChatGPT0
  6. 06

    OpenCode Skills 使用指南:技能目录、命名规则、权限配置与不加载排查

    OpenCode 的 Skills 放在哪个目录、怎么控制哪些技能能用?按 OpenCode 官方文档讲清六个扫描位置、name 的正则规则、skill 工具的工作方式、在 opencode.json 里用 allow / deny / ask 配置权限、按智能体覆盖,以及技能不出现时的五项检查。

    其他 AI 工具0

同产品的其他教程

  1. 01

    npx skills add 怎么用:从 GitHub 安装 Skill、skills.sh 是什么与常用命令

    网上的 Skill 安装命令大多是 npx skills add 开头,它是什么、装到哪去了?按官方 README 讲清 skills 命令行工具支持的来源写法、项目与全局两种范围、-a 指定工具、list / find / update / remove 等命令、软链接与复制的区别,以及怎么关掉遥测。

    Claude其他 AI 工具0
  2. 02

    即梦首尾帧怎么用:两张图生成过渡视频(在哪里、提示词、不能用怎么办)

    即梦首尾帧在哪里、怎么用?本文讲清首尾帧入口、哪些模型支持、两张图的比例要求、过渡提示词怎么写,以及「首尾帧不见了 / 不能用了」「画面跳变」的原因和解决办法。

    其他 AI 工具0
  3. 03

    DeepSeek怎么用:网页版与手机App入门(深度思考、智能搜索、上传文件)

    DeepSeek怎么用?本文从官方入口和登录方式讲起,说清输入框里的「深度思考」「智能搜索」和上传附件各管什么,历史对话怎么改名、置顶、分享和导出,以及手机上使用的注意点。

    其他 AI 工具0
  4. 04

    文心一言网页版怎么用:改名「文心」后的入口、对话与工作任务、PPT生成

    文心一言现在叫什么、网页版入口在哪、怎么用?本文按百度文心官网和 App Store 官方页面讲清「文心」的新入口、对话与工作两种模式、图片生成和帮我写作、任务托管与 AIPPT、知识库和定时任务从哪开始。

    其他 AI 工具0
  5. 05

    Trae 规则与 MCP 配置教程:.trae/rules 四种生效方式、导入 AGENTS.md、添加 MCP Server

    Trae rules 怎么配置、Trae 怎么用 MCP?按 TRAE 官方中文文档讲清全局规则与项目规则的位置、四种生效方式、子目录与多层嵌套、导入 AGENTS.md / CLAUDE.md、提交信息规则,以及从市场添加和手动配置 MCP Server、项目级 mcp.json。

    其他 AI 工具0
  6. 06

    AI 写小红书、公众号内容的流程,以及 AI 生成内容怎么标识(标识办法要点)

    用 AI 写小红书文案、公众号文章要不要标注 AI 生成?按国家网信办等四部门《人工智能生成合成内容标识办法》原文讲清显式与隐式标识、发布者的声明义务、不能删除水印;并给出从选题到发布的六步写作流程和发布前自查表。

    ChatGPT其他 AI 工具0

0 条评论

登录 后参与评论

还没有评论,来抢沙发~