確定性抽取層:不用任何模型,先解決八成的 PDF
數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。
數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。
TTS 支援 ElevenLabs/Microsoft/OpenAI 三家,PDF 有 native 和 extraction 兩種模式,Lobster 是確定性工作流 runtime,MCP 支援外部工具擴展。