Skip to content
所有標籤

#web-extraction

2 篇文章
ai deep-dive

Parallel Web Systems:Agent 的搜尋、擷取與深度研究層

Parallel Web Systems 把 Search、Extract 與 Task API 分成三個成本與延遲不同的網路存取層,並以 Basis 把引用、摘錄與信心標到輸出欄位。

網頁抽取品質實測:Crawl4AI、Firecrawl、Jina Reader 與 Readability 差多少?

抽取工具不能只比 HTTP 200;同一組 20 個 URL 要分別量正文、heading、table、code、link、metadata、雜訊、延遲與成本。本文先公開 corpus、adapter contract 與評分 gate,但因目前缺 Firecrawl credential 與四條同版本 raw run,尚不發佈勝負。