Skip to content
系列
5 篇文章

文件解析實戰

把文件變成 LLM 可讀內容的三層階梯——轉換、抽取、解析。從選層邏輯到 MarkItDown、anydoc、MinerU 等各層工具的取捨比較。

ai deep-dive 文件解析實戰

文件解析的三層階梯:轉換、抽取、解析,先選對層再選工具

把文件餵給 LLM 之前,最常見的錯誤不是選錯工具,是選錯層。結構已經在檔案裡的用轉換層(毫秒級),有文字沒結構的用抽取層,連文字都要推斷的才用解析層——anydoc 的 4.7ms 到 Docling 的 513.6ms 差 109 倍,多數人卻直接跳最貴的那層。

ai guide 文件解析實戰

MarkItDown:把任何檔案餵給 LLM 之前,先讓它變成 Markdown

Microsoft 開源的輕量工具,把 PDF、Office、圖片、音訊等格式統一轉成 Markdown,專門為 LLM pipeline 設計。

ai deep-dive 文件解析實戰

anydoc:14 種辦公格式轉 Markdown,Firecrawl 用 Rust 給的另一個答案

Firecrawl 開源的 Rust 轉檔函式庫,14 種辦公格式(含 .doc / .ppt / .xls 老格式)統一轉 GFM,中位耗時 4.7ms,同樣計時條件下比 Docling 快 109 倍。代價是完全不碰 OCR。

ai deep-dive 文件解析實戰

確定性抽取層:不用任何模型,先解決八成的 PDF

數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。

ai deep-dive 文件解析實戰

解析層:當結構要用模型推斷——而授權才是真正的選型軸

掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。