Skip to content
系列
17 篇文章

搜尋與爬取實戰

把資料從外面弄進來的整條路:搜尋要租雲端 API 還是自己架、爬取工具怎麼選、被反爬擋住怎麼辦,最後怎麼把這些接成一條研究流程。每篇談一個決定,讀完能拼出一套自己的取得管道。

ai guide 搜尋與爬取實戰

AI Agent 接搜尋 MCP 工具:當 WebFetch / WebSearch 被擋的時候

用 Claude Code、Cursor 等 AI agent 時,內建 WebFetch / WebSearch 常被 Cloudflare、地理限制或 rate limit 擋住。接一個 search MCP server 是最直接的解法,這篇比較 2026 年實際能用的選項。

Tavily 和 Exa 不能自己架:要怎麼自己組一套

Tavily 和 Exa 都是純雲端 API,不能自己架。能自己組的是 SearXNG(269 個上游引擎、82 個預設開啟)+ Crawl4AI(78.8k stars、Apache-2.0),現成的 Tavily 相容 wrapper 都還是幾十顆星的個人專案,不建議直接用。但 SearXNG 沒有自己的索引,而且從機房 IP 跑會被搜尋引擎打成空結果——這兩件事決定了自架划不划算。

ai guide 搜尋與爬取實戰

自己架一套搜尋後端:SearXNG + Crawl4AI,從零到接進 Claude Code

三個元件、各做一件事:SearXNG 負責找、Crawl4AI 負責讀、一層薄薄的程式把兩者黏起來。有三個預設值不改就不會動——`formats` 預設只吐 HTML、`secret_key` 預設是 `ultrasecretkey`、limiter 開了會擋你自己的程式。另外官方安裝方式在 2026 年 3 月換過,網路上多數教學指的 searxng-docker 已經封存了。

AI 爬蟲工具全景圖:34 個開源專案的五大分類與選型指南

從 MarkItDown (175k stars, MIT) 到 curl_cffi (6k stars),整理 34 個「爬資料餵 AI」的開源工具。沿五條軸線分類:整站爬取、AI 瀏覽器代理、文件轉檔、智慧擷取、反偵測基建。選型關鍵不是哪個最好,是場景匹配。

tech guide 搜尋與爬取實戰

AI Agent 繞過 Cloudflare 反爬蟲完整指南:從踩坑到自建 MCP Server

標準 Playwright 無法通過 Cloudflare 驗證。playwright-extra + stealth 和 nodriver 都能繞過,最終包成 MCP server 讓 AI agent 自動使用。

ai guide 搜尋與爬取實戰

Local Deep Research 導讀:本地優先的深度研究 Agent

Local Deep Research 是個本地優先、隱私導向的深度研究 Agent,用 LangChain + LangGraph 串起 20+ 搜尋引擎和 30+ 種研究策略,旗艦的 langgraph_agent_strategy 走 LLM 自主 tool-calling 路線,跟固定流程的 RAG graph 是兩種思路。

AI Agent 上網查資料的完整路由:Search、Fetch、Crawler、Browser 怎麼切換

Agent 上網不該一律開瀏覽器:先依任務分流 Search 或 Fetch,再按狀態碼、內容品質、JS shell、登入與 challenge 訊號逐級升級;每一步都受 retry、budget、快取、去重與來源紀錄約束。

Agent 搜尋品質怎麼驗收:Web Retrieval Benchmark 實作

Web retrieval 要測的是完整 task,不是 HTTP 200:固定 30 題、五種失敗層、三條 live channel,同時量答案、引用、freshness、延遲、成本與不必要升級。本文交付可執行 harness 與 gate,但因目前沒有三條 live channel 設定,不提供虛構排名。

Agent 搜尋 Query 怎麼寫:關鍵字、語意描述、拆解與改寫

Agent 不該把使用者原句直接丟給每一種搜尋服務:先辨認 exact lookup、keyword、semantic 或 fielded search,再把來源、時間、語言與欄位限制放進 provider 原生參數,最後依零結果、結果過廣與來源不對症狀改寫。

網頁抽取品質實測:Crawl4AI、Firecrawl、Jina Reader 與 Readability 差多少?

抽取工具不能只比 HTTP 200;同一組 20 個 URL 要分別量正文、heading、table、code、link、metadata、雜訊、延遲與成本。本文先公開 corpus、adapter contract 與評分 gate,但因目前缺 Firecrawl credential 與四條同版本 raw run,尚不發佈勝負。

從搜尋結果到可靠引用:URL 去重、來源分級與 Claim-Source Mapping

可靠引用不是在答案後面塞 URL:先把 URL、內容副本與來源獨立性拆開,再用 atomic claim、quote span、snapshot 與可重跑檢查建立 claim-source matrix。

學術搜尋怎麼組:arXiv、OpenAlex、Crossref、Semantic Scholar 與 PubMed 的分工

學術搜尋不能把五個 API 的結果直接串起來:先用 arXiv/PubMed 做領域發現,再用 DOI、PMID、arXiv ID 對齊 OpenAlex/Semantic Scholar,最後由 Crossref 與 PubMed 關係資料檢查正式版本、勘誤與撤稿。

ai guide 搜尋與爬取實戰

需要登入的網站怎麼交給 Agent:Session、權限與自動化邊界

登入狀態不是方便攜帶的設定,而是一把能冒用身分的鑰匙。安全做法是使用專用低權限帳號與隔離 browser profile,把讀取、可逆寫入、高風險交易拆成三級,MFA 與最後提交留給人。

Keenable 該放進台灣 Agent 團隊的搜尋備選嗎?

Keenable.ai 把自己定位成給 AI agents 用的搜尋基礎設施:100B+ 文件索引、Search/Fetch API、 MCP/CLI 入口、100K 免費月額度與 keyless public endpoint。對台灣/繁中 agent 團隊來說, 現階段最合理的位置是 provider matrix 裡的實測候選;Brave、Exa、Tavily 或 Serper 仍要留著對照。

ai 搜尋與爬取實戰

TinyFish 介紹:為 AI Agent 設計的免費 Search 與 Fetch 基礎設施

TinyFish 為 AI agent 提供四個 Web API——Search、Fetch、Agent、Browser,其中 Search 與 Fetch 為 $0 永久免費且免信用卡,適合做 RAG 與文件檢索的預設層。

Jina Reader 完整指南:把網頁轉成 Agent 可讀 Markdown

Jina Reader 把單一 URL 轉成適合 LLM 使用的 Markdown;真正上線時,還要控制渲染時機、正文範圍、token 上限與失敗回退。

ai guide 搜尋與爬取實戰

Linkup Search API 完整指南:從 standard、deep 到結構化輸出

Linkup 把搜尋深度與輸出格式分開控制:多數 agent 查詢先用 standard + searchResults,需要循線讀多頁才升到 deep;每月補回 20 美元是餘額恢復,不是固定再送 20 美元。