所有標籤商業文件解析分三條路線:專用 Parser(Cohere Parse $1.50/千頁、LlamaParse Agentic Plus 90.2%)、三大雲 Prebuilt(Azure/Google/AWS,結構化欄位抽取)、直接用通用 VLM(Fable 5.1 在 ParseBench 拿 78.92,圖表理解碾壓專用 parser,但每頁成本 3-16 倍且會幻覺)。10 萬頁/月純 OCR 各家都 ~$150,加表格後 AWS 跳到 $1,500、用 Claude Sonnet 5 跑要 $900。選型的第一個問題不是「哪家最準」,是「你要轉錄還是理解」。
document_parse 新增 effort 參數(fast/standard/deep)把 anydoc WASM、OCR.space、Docling VLM 三條路徑統一成一個旋鈕;document_chunk 的 fieldAware 模式從表格 header 和 metadata 抽欄位名附到 chunk,解決 RAG 的 attribute conflation;document_smart_parse 回傳 confidence 分數讓 agent 自己決定要不要升級。
Groundlane v0.1.0 新增四個品質機制:web_extract 的 selector healing(三層確定性 fallback,不用 LLM)、corpus_retrieval_test(RAG 召回品質驗證,受 RAGFlow 啟發)、document benchmark CLI(character-level F1)、search benchmark framework(ground truth corpus + 多 provider 比較)。工具數從 54 增至 55。
Marker(Datalab 開源,Apache 2.0 授權,v2.0.0 於 2026-07-20 發布,39.5k stars)是一個以 Markdown 與 JSON 為輸出的 pipeline 式文件解析標準庫,支援 PDF、圖像、PPTX、DOCX、XLSX、HTML、EPUB,並提供可選的 LLM 增強(`--use_llm`,預設 `gemini-3.5-flash`)、可自訂格式邏輯與表格/公式/內嵌數學/連結/參考/程式碼區塊的完整處理、圖像提取與保存、標頭/頁尾移除,並可在純 CPU、GPU 或 MPS(Apple Silicon)環境運作。與 [Docling](/posts/tech/2026-09-06-docling-document-parsing) 同屬解析層,但授權路徑(`Apache 2.0` 代碼 + `AI Pubs Open Rail-M` 模型權重,有商業門檻 `$5M`)、輸出核心(`Markdown` 為主而非結構化 `JSON`)、解析引擎特點(`Pipeline` 式可替換階段,但 `VlmPipeline` 為可選的 `LLM` 增強而非固定 `VLM` 選項)、與 [MinerU](/posts/tech/2026-09-05-mineru-ocr-doc-parsing)(自訂協議、`Markdown` 為核心、`Hybrid` `effort` 參數)的差異形成解析層內三種不同取捨路徑。
Docling(IBM Research Zurich 起源,現由 Linux Foundation AI & Data 治理,MIT 授權,v2.100.0 於 2026-06-09 發布)是一個以結構化 JSON 為核心輸出的文件解析標準庫,支援 PDF、DOCX、PPTX、XLSX、HTML、EPUB、Apple Pages、影片(MP4/AVI/MOV,含 ASR 轉錄與代表性幀)、音訊(WAV/MP3)、電子郵件(EML/MSG)、ODF 與 XBRL 財報,並提供可替換階段的 pipeline 式解析(純 CPU 或 GPU 加速)、VlmPipeline 選項(GraniteDocling 258M VLM)、MCP server 與 API server(docling-serve),與 LangChain / LlamaIndex / Crew AI / Haystack 原生整合。
MinerU 是 OpenDataLab 的開源文件解析引擎,可將 PDF、圖像與 Office 文件轉成保留表格、公式和閱讀順序的 Markdown 與 JSON,適合 RAG 前處理與知識庫建構。
傳統文件解析用固定 pipeline 一體適用,但合約、財報、技術手冊各需不同策略。Agentic Parsing 讓 LLM agent 觀察文件後動態選工具——AgenticOCR 只解析需要的區域(視覺 token 省 70%+)、ParseBench 2,000 頁企業文件實測最佳方案也只拿 84.9%,沒有銀彈。
NousResearch/hermes-agent 靠自我學習迴圈記住怎麼用你的工具、跨平台記得你是誰,239,994 星持續衝榜;pacifio/atlas 讓多個 coding agent 共用一套「看得到是誰改的」版本控制,一天漲 895 星;blader/humanizer 用 35 種模式把 AI 味洗掉但不竄改事實。文件處理端 firecrawl/pdf-inspector 用 Rust 在 50ms 內判斷 PDF 要不要 OCR;superlinked/sie 把 agent 會用到的所有模型收進一個自架推理叢集。框架端 AG2 v1.0.3 全面遷移 MCP 2.0(breaking change),並加入不靠 LLM 判斷的 TealTigerMiddleware 做 prompt injection 防護。
RAGFlow 把文件解析、chunk 人工檢查、retrieval test、聊天與引用放在同一套平台;適合 PDF、表格與版面複雜文件,但部署重量和平台狀態都高於 Python library。
用 4 份台大碩班掃描考古題實測 10 種開源 PDF 解析工具。VLM 類(Firecrawl、MinerU 3.4、Marker v2)在公式和程式碼上全面碾壓傳統 OCR,但安裝踩坑才是真正的門檻——MinerU 舊包名會進依賴地獄、Marker 首次模型下載要 10 分鐘、PaddleOCR 缺引擎。實務推薦兩階段策略:RapidOCR 粗篩 + MinerU/Firecrawl 精查。
掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。
把文件餵給 LLM 之前,最常見的錯誤不是選錯工具,是選錯層。結構已經在檔案裡的用轉換層(毫秒級),有文字沒結構的用抽取層,連文字都要推斷的才用解析層——anydoc 的 4.7ms 到 Docling 的 513.6ms 差 109 倍,多數人卻直接跳最貴的那層。
數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。
把『使用者上傳檔案就自動切 chunk、embedding』設為預設行為,等於替 LLM 預先做了一個它本來可以自己做的決定。從 Self-RAG (2310.11511)、Adaptive-RAG (2403.14403) 到 AgenticOCR (2602.24134) 這條學術線索,正在把『要不要 retrieve、要不要 parse、怎麼切 chunk』三層決策權,從 ingestion pipeline 往後推到對話時的 agent。