Skip to content

MinerU:從 PDF 到 Markdown 的開源文件解析引擎,為 RAG 與 LLM 訓練而生

Sep 5, 20261 min
TL;DRMinerU(OpenDataLab / opendatalab/MinerU)是一個開源文件解析引擎,把 PDF、圖像、DOCX、PPTX、XLSX 轉成結構化 Markdown 與 JSON,內建公式識別、表格提取與 109 語言 OCR,起源於 InternLM 前訓練階段,適合 RAG 前處理與知識庫建構。
Table of Contents
  1. 它想解決什麼
  2. 核心能力
    1. 輸入與輸出
    2. 結構化解析
    3. OCR 與掃描修復
    4. 部署與運作
  3. 與替代方案比較
  4. 適用情境
    1. RAG 前處理與知識庫建構
    2. LLM 訓練資料清洗
    3. 學術文獻與技術文件整理
    4. 掃描文件數位化
  5. 部署與實際限制
  6. 整體取捨
  7. 參考資料
Series: 文件解析實戰 (8 / 2)

每次要把一份學術論文、公司內部 PDF 報告、或掃描版合約丟進 RAG 流程,第一個卡關的點通常不是向量化,而是文件解析:文字被切斷、表格變成混亂的段落、公式被當成亂碼、掃描圖直接無法讀取。商業方案(如 Azure Document Intelligence)能解決一部分,但成本、隱私與格式鎖定讓人猶豫;開源方案(PaddleOCR、Tesseract)則常常在結構化輸出這一步缺席。

MinerU 是 OpenDataLab 開源的一個文件解析引擎,目標很直接:把複雜文件(PDF、圖像、DOCX、PPTX、XLSX)轉成機器可讀的 Markdown 與 JSON,並在過程中保留表格結構、公式語意、圖文關聯,以及掃描文件的可讀性。它不是單純的 OCR,而是從頁面解析到文件語意結構的完整管線。

它想解決什麼

MinerU 的誕生背景很具體:在 InternLM 的前訓練階段,團隊需要把大量科學文獻與技術文件轉成乾淨的訓練語料,但現有工具在符號轉換(公式、表格、圖文混排)上表現不穩定。MinerU 因此被設計成一個專為大模型資料準備的解析引擎,而非通用的文件轉檔工具。

這讓它的設計目標與一般 OCR 工具有明顯差異:

  • 不是只提取文字,而是保留結構:表格轉成 HTML、公式保留 LaTeX、段落維持閱讀順序。
  • 不是只處理數位原生 PDF,也處理掃描圖:內建 OCR 與掃描修復,支援 109 種語言的文字檢測與識別。
  • 輸出不是純文字,而是多格式機器可讀資料:Markdown(適合人讀與 LLM 讀)、JSON(適合結構化檢索與資料庫)、以及中間格式(適合後續處理)。

核心能力

從官方文件與 GitHub 說明來看,MinerU 的核心功能可以分成幾層:

輸入與輸出

  • 支援格式:PDF(含掃描)、圖像(PNG/JPG)、DOCX、PPTX、XLSX。
  • 輸出格式:Markdown(含多模態與 NLP 兩種風格)、JSON(閱讀順序排序,含段落、表格、公式、圖像關聯)、HTML(表格專用)、以及中間解析格式(可再加工)。

結構化解析

  • 表格識別與提取:自動偵測表格區域,轉成 HTML 結構,而非把表格內容當成亂序段落輸出。對需要從報表、論文數據表中提取資訊的 RAG 流程來說,這是關鍵差異。
  • 公式識別:自動偵測數學公式區域,輸出為可讀的 LaTeX 或結構化表示,避免公式被當成亂碼文字。
  • 圖文關聯:在輸出中保留圖像與周圍文字的關聯關係,讓後續處理知道「這張圖屬於哪個段落」或「這個公式對應哪段說明」。

OCR 與掃描修復

  • OCR 引擎:支援 109 種語言的文字檢測與識別,對中文、英文、日文、韓文等常見語言有覆蓋。
  • 掃描 PDF 修復:自動偵測掃描或亂碼 PDF,啟用 OCR 管線進行文字還原,而非直接放棄或輸出空白。
  • 混合解析(Hybrid Parsing):在 3.3 與後續版本中,混合解析(數位原生 + 掃描混合)的準確度與效率有明顯優化,模型下載與快取機制也更穩定。

部署與運作

  • 本機部署:GitHub 提供完整安裝腳本與 Docker 支援,可在自己的機器上跑,不需要把敏感文件上傳到雲端。
  • 多 GPU 支援:支援多 GPU 並行,對批量文件處理(如整批論文預處理)有實際幫助。
  • API 與 SDK:提供 Python 客戶端(官方核心支援)、Go SDK(見生態系 MinerU-Ecosystem repo)、以及線上 API(mineru.net),可依需求選擇本機或遠端服務。
  • 模型管理:首次安裝會下載模型,後續有快取機制;版本更新(如 3.3、3.4)會自動處理模型升級與相容性。

與替代方案比較

選擇文件解析工具時,通常不是「哪個最好」,而是「哪個最適合你的資料形態與輸出需求」。以下表格為功能定位比較(非基於同一基準測試的效能排名),僅供參考:

工具 / 方案核心定位結構化輸出公式與表格OCR 覆蓋部署模式適合場景
MinerU文件解析(PDF/圖像 → Markdown/JSON)高(保留結構與語意)公式識別、表格 HTML109 語言、掃描修復本機 / Docker / APIRAG 前處理、LLM 訓練資料、知識庫建構
PaddleOCR文字檢測與識別(OCR 為主)低(純文字為主,結構需額外處理)無內建公式處理中文、英文為主本機 / 雲端快速文字提取、掃描文件轉文字
Tesseract傳統 OCR 引擎低(純文字輸出,無結構)多語言但準確度較低本機簡單掃描文件、預算有限場景
Docling文件理解與轉換(IBM 開源)中(支援 Markdown、HTML 輸出)有表格與公式支援透過內建 OCR 或外部引擎本機 / 雲端企業文件自動化、通用文件轉檔
GLM-OCR大模型驅動 OCR中高(依模型能力)依模型實現依模型實現本機 / API(需 GPU)高精度需求、願意承擔模型成本的場景

MinerU 的定位不是「最強 OCR」,而是最完整的文件解析到機器可讀結構。如果你只需要從一張掃描發票提取文字,PaddleOCR 或 Tesseract 夠用且更輕量;但如果你要把整份學術論文、技術手冊、或內部報告轉成可被 LLM 直接理解與檢索的結構化資料,MinerU 的表格、公式與圖文關聯保留能力會明顯減少後續清洗成本。

值得注意的是,MinerU 仍在快速演進中(3.3、3.4 版本在 2026 年持續發布,OCR 能力與混合解析效能有明顯提升)。這意味著它的準確度與功能邊界會隨版本變化,每次引用具體數據或功能時,建議確認對應的版本號與發布日期,而非把某個版本的表現當成永久特性。

適用情境

根據官方定位與實際功能,MinerU 最適合以下幾類工作:

RAG 前處理與知識庫建構

把企業內部 PDF 報告、產品手冊、法規文件轉成結構化 Markdown 與 JSON,再餵給向量資料庫。表格保留為 HTML 讓檢索時可以提取完整數據、公式保留為 LaTeX 讓技術文件可被準確理解、圖文關聯讓多模態檢索(圖像 + 文字)成為可能。

LLM 訓練資料清洗

在預訓練或微調階段,需要大量乾淨的技術文獻與文件資料。MinerU 的中間解析格式與多輸出選項,讓資料工程師可以在「原始解析」與「最終訓練語料」之間做更細緻的轉換與篩選,而非直接從混亂 PDF 跳到純文字。

學術文獻與技術文件整理

對研究者或工程師來說,從 PDF 提取結構化內容(含表格數據、公式、圖表描述)可以大幅減少手動整理時間。特別是需要把多份論文的數據表整合成比較表格時,結構化輸出比純文字提取省下大量後處理時間。

掃描文件數位化

對有大量紙本文件(合約、發票、歷史檔案)的組織,MinerU 的掃描修復與 OCR 管線可以在本機完成,不需要把敏感文件上傳到第三方雲端服務,對隱私與合規有實際價值。

部署與實際限制

實際使用 MinerU 前,有幾個現實限制值得先知道:

  • 首次安裝成本:模型下載與環境設定需要時間與網路,首次安裝體驗不如輕量 OCR 工具(如 Tesseract)的「下載即用」快速。
  • 處理速度與資源:高精度解析需要 GPU 加速(特別是混合解析與大模型輔助的場景),純 CPU 運作可行但速度明顯下降。對批量處理來說,多 GPU 並行是實用選項,但也增加部署複雜度。
  • 準確度邊界:官方的後處理框架 MinerU-Popo 在公開基準測試(如 ViDoRe V3、MMDA)上相較於直接使用預訓練模型(如 Qwen3-VL 系列)的輸出顯示有提升,但這些數據是特定測試集(表格提取指標 TEDS、文件速度 Doc/s、各維度分數)上的後處理結果,不是 MinerU 核心解析引擎與 VLM 在同任務上的直接對比;實際文件(特別是非英文、非標準排版、或高度圖文混排的文件)的準確度仍需逐份驗證。
  • 版本演進:功能與模型在快速更新中(3.3、3.4 版本在 2026 年持續發布),長期使用時需要追蹤版本相容性與模型升級策略,而非假設某個版本的行為會永久不變。
  • 商業與本機的選擇:GitHub 開源版與 mineru.net 線上 API 提供不同部署模式,本機版適合隱私敏感場景,API 版適合快速驗證與小規模使用,但兩者在模型能力與功能完整度上可能存在差異,引用時應明確標註使用的來源與版本。

整體取捨

MinerU 的核心價值不在於「取代所有 OCR 工具」,而在於把文件解析從「提取文字」提升到「保留語意結構」。對只需要快速文字提取的場景,它可能過於複雜且資源密集;但對需要把複雜文件轉成機器可讀、可檢索、可再加工的結構化資料的場景(特別是 RAG、LLM 訓練、知識管理),它提供了一個完整且可本機部署的解決方案。

它的開源許可為基於 Apache 2.0 的自訂協議(MinerU Open Source License,見 LICENSE.md),含商業使用門檻(MAU > 1 億 或 月收入 > 2,000 萬美元需另行授權)與線上服務標識義務,並非純 Apache 2.0;社群仍在持續演進(OpenDataLab、InternLM 生態系),功能邊界會隨 3.3、3.4 等版本擴展,但同時也要求使用者對版本、模型與部署環境有基本掌握,而非把它當成「裝好就忘記」的黑盒工具。

如果你正在建構一個需要大量文件預處理的知識系統,或正在為 LLM 準備高品質訓練語料,MinerU 值得花時間試用一週,確認它對你的文件類型與精度需求的實際表現,再決定是否納入長期流程。

參考資料