Skip to content
所有標籤

#document-parsing

14 篇文章

商業文件解析 API 橫評:專用 Parser、通用 VLM、三大雲,交叉點在哪?

商業文件解析分三條路線:專用 Parser(Cohere Parse $1.50/千頁、LlamaParse Agentic Plus 90.2%)、三大雲 Prebuilt(Azure/Google/AWS,結構化欄位抽取)、直接用通用 VLM(Fable 5.1 在 ParseBench 拿 78.92,圖表理解碾壓專用 parser,但每頁成本 3-16 倍且會幻覺)。10 萬頁/月純 OCR 各家都 ~$150,加表格後 AWS 跳到 $1,500、用 Claude Sonnet 5 跑要 $900。選型的第一個問題不是「哪家最準」,是「你要轉錄還是理解」。

Groundlane 實戰系列(篇 6):Document 工具全家桶 — effort 旋鈕、field-aware chunking 與 confidence routing

document_parse 新增 effort 參數(fast/standard/deep)把 anydoc WASM、OCR.space、Docling VLM 三條路徑統一成一個旋鈕;document_chunk 的 fieldAware 模式從表格 header 和 metadata 抽欄位名附到 chunk,解決 RAG 的 attribute conflation;document_smart_parse 回傳 confidence 分數讓 agent 自己決定要不要升級。

techdeep-dive

Groundlane 實戰系列(篇 7):Selector Healing、Retrieval Test 與品質 Benchmark

Groundlane v0.1.0 新增四個品質機制:web_extract 的 selector healing(三層確定性 fallback,不用 LLM)、corpus_retrieval_test(RAG 召回品質驗證,受 RAGFlow 啟發)、document benchmark CLI(character-level F1)、search benchmark framework(ground truth corpus + 多 provider 比較)。工具數從 54 增至 55。

Marker: Datalab's Open-Source, Apache 2.0 Pipeline Parser — Faster, CPU-Ready, More Accurate

Marker(Datalab 開源,Apache 2.0 授權,v2.0.0 於 2026-07-20 發布,39.5k stars)是一個以 Markdown 與 JSON 為輸出的 pipeline 式文件解析標準庫,支援 PDF、圖像、PPTX、DOCX、XLSX、HTML、EPUB,並提供可選的 LLM 增強(`--use_llm`,預設 `gemini-3.5-flash`)、可自訂格式邏輯與表格/公式/內嵌數學/連結/參考/程式碼區塊的完整處理、圖像提取與保存、標頭/頁尾移除,並可在純 CPU、GPU 或 MPS(Apple Silicon)環境運作。與 [Docling](/posts/tech/2026-09-06-docling-document-parsing) 同屬解析層,但授權路徑(`Apache 2.0` 代碼 + `AI Pubs Open Rail-M` 模型權重,有商業門檻 `$5M`)、輸出核心(`Markdown` 為主而非結構化 `JSON`)、解析引擎特點(`Pipeline` 式可替換階段,但 `VlmPipeline` 為可選的 `LLM` 增強而非固定 `VLM` 選項)、與 [MinerU](/posts/tech/2026-09-05-mineru-ocr-doc-parsing)(自訂協議、`Markdown` 為核心、`Hybrid` `effort` 參數)的差異形成解析層內三種不同取捨路徑。

tech文件解析實戰

Docling:IBM 開源、MIT 授權、結構化 JSON 為核心的文件解析標準庫

Docling(IBM Research Zurich 起源,現由 Linux Foundation AI & Data 治理,MIT 授權,v2.100.0 於 2026-06-09 發布)是一個以結構化 JSON 為核心輸出的文件解析標準庫,支援 PDF、DOCX、PPTX、XLSX、HTML、EPUB、Apple Pages、影片(MP4/AVI/MOV,含 ASR 轉錄與代表性幀)、音訊(WAV/MP3)、電子郵件(EML/MSG)、ODF 與 XBRL 財報,並提供可替換階段的 pipeline 式解析(純 CPU 或 GPU 加速)、VlmPipeline 選項(GraniteDocling 258M VLM)、MCP server 與 API server(docling-serve),與 LangChain / LlamaIndex / Crew AI / Haystack 原生整合。

tech文件解析實戰

MinerU:從 PDF 到結構化 Markdown 的文件解析引擎

MinerU 是 OpenDataLab 的開源文件解析引擎,可將 PDF、圖像與 Office 文件轉成保留表格、公式和閱讀順序的 Markdown 與 JSON,適合 RAG 前處理與知識庫建構。

Agentic Parsing:讓 Agent 決定怎麼解析文件

傳統文件解析用固定 pipeline 一體適用,但合約、財報、技術手冊各需不同策略。Agentic Parsing 讓 LLM agent 觀察文件後動態選工具——AgenticOCR 只解析需要的區域(視覺 token 省 70%+)、ParseBench 2,000 頁企業文件實測最佳方案也只拿 84.9%,沒有銀彈。

AI Agent GitHub Digest — 2026-09-03

NousResearch/hermes-agent 靠自我學習迴圈記住怎麼用你的工具、跨平台記得你是誰,239,994 星持續衝榜;pacifio/atlas 讓多個 coding agent 共用一套「看得到是誰改的」版本控制,一天漲 895 星;blader/humanizer 用 35 種模式把 AI 味洗掉但不竄改事實。文件處理端 firecrawl/pdf-inspector 用 Rust 在 50ms 內判斷 PDF 要不要 OCR;superlinked/sie 把 agent 會用到的所有模型收進一個自架推理叢集。框架端 AG2 v1.0.3 全面遷移 MCP 2.0(breaking change),並加入不靠 LLM 判斷的 TealTigerMiddleware 做 prompt injection 防護。

aideep-dive

RAGFlow 深入介紹:從文件解析、Chunk 檢查到可追溯回答

RAGFlow 把文件解析、chunk 人工檢查、retrieval test、聊天與引用放在同一套平台;適合 PDF、表格與版面複雜文件,但部署重量和平台狀態都高於 Python library。

掃描 PDF 實測:10 種解析工具丟進考古題,結果差多少?

用 4 份台大碩班掃描考古題實測 10 種開源 PDF 解析工具。VLM 類(Firecrawl、MinerU 3.4、Marker v2)在公式和程式碼上全面碾壓傳統 OCR,但安裝踩坑才是真正的門檻——MinerU 舊包名會進依賴地獄、Marker 首次模型下載要 10 分鐘、PaddleOCR 缺引擎。實務推薦兩階段策略:RapidOCR 粗篩 + MinerU/Firecrawl 精查。

解析層:當結構要用模型推斷——而授權才是真正的選型軸

掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。

文件解析的三層階梯:轉換、抽取、解析,先選對層再選工具

把文件餵給 LLM 之前,最常見的錯誤不是選錯工具,是選錯層。結構已經在檔案裡的用轉換層(毫秒級),有文字沒結構的用抽取層,連文字都要推斷的才用解析層——anydoc 的 4.7ms 到 Docling 的 513.6ms 差 109 倍,多數人卻直接跳最貴的那層。

確定性抽取層:不用任何模型,先解決八成的 PDF

數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。

aideep-dive

上傳檔案就自動 embedding 是個壞預設:Adaptive / Agentic RAG 與 Agentic Parsing 論文導讀

把『使用者上傳檔案就自動切 chunk、embedding』設為預設行為,等於替 LLM 預先做了一個它本來可以自己做的決定。從 Self-RAG (2310.11511)、Adaptive-RAG (2403.14403) 到 AgenticOCR (2602.24134) 這條學術線索,正在把『要不要 retrieve、要不要 parse、怎麼切 chunk』三層決策權,從 ingestion pipeline 往後推到對話時的 agent。