AI 爬蟲管理新挑戰:
Mixed-use Crawler 與企業網站內容控管

隨著生成式 AI、AI 搜尋與 AI Agent 快速發展,企業網站面對的自動化流量也正在改變。過去網站管理者主要關注搜尋引擎爬蟲與惡意 Bot,如今則需要進一步思考:網站內容是否會被 AI 爬取?這些內容是用於搜尋、AI 訓練,還是由 AI Agent 代表使用者取得資訊?

Cloudflare 最新針對 AI 爬蟲管理提出新的 Disallow AI Training 設定,讓網站管理者可以在維持搜尋曝光的同時,進一步控制網站內容是否允許被用於 AI 訓練。這也反映出企業網站的 Bot 管理,正從單純的「允許或封鎖」,逐步走向更細緻的內容使用治理。

什麼是 AI 爬蟲?

AI 爬蟲(AI Crawler)是指為 AI 相關用途存取網站內容的自動化程式。Cloudflare 目前依照爬蟲行為,將相關流量區分為三種類型:

  • Search:爬取網站內容並建立搜尋引擎索引。
  • Training:爬取網站內容,用於 AI 模型訓練或微調。
  • Agent:由使用者發起,代表使用者造訪網站並取得資訊,例如 AI 搜尋或瀏覽型 Agent。

這三種爬蟲雖然都可能存取企業網站,但背後目的並不相同,因此網站管理者也不一定需要採取相同的管理方式。

Mixed-use Crawler 為什麼讓企業更難管理?

Mixed-use Crawler(混合用途爬蟲)是目前 AI 爬蟲管理中特別值得注意的一類。

簡單來說,同一個爬蟲可能同時負責搜尋與 AI 訓練。例如網站希望搜尋引擎持續索引內容,讓使用者可以透過搜尋找到網站;但另一方面,企業可能又不希望相同內容被拿去進行 AI 模型訓練。

過去如果直接封鎖這類爬蟲,就可能同時影響搜尋曝光。因此,網站管理者長期面臨一個兩難:

  • 允許爬蟲存取,維持搜尋曝光,但可能同時允許 AI 訓練。
  • 封鎖爬蟲,可以限制 AI 訓練,但也可能影響網站搜尋能見度。

這也是為什麼 AI 爬蟲管理不能只用「全部允許」或「全部封鎖」來處理。

Cloudflare 推出 Disallow AI Training

針對 Mixed-use Crawler 所帶來的管理問題,Cloudflare 推出 Disallow AI Training 設定。

當網站管理者選擇 Disallow AI Training 後,Cloudflare 會透過 Bot Preference Sync 將相關偏好同步至 robots.txt,讓符合條件的混合用途爬蟲可以繼續進行搜尋索引,同時遵循網站管理者對 AI 訓練的限制。

對企業而言,這代表網站內容管理可以從過去的「要不要封鎖 AI」,進一步細分成「哪些用途可以接受、哪些用途需要限制」。

robots.txt 為什麼仍然需要搭配其他安全機制?

robots.txt 長期以來都是網站管理爬蟲的重要機制,但它主要是向爬蟲表達網站管理者的存取偏好。

單靠 robots.txt,網站管理者仍然難以完整掌握爬蟲的實際行為,例如:

  • 目前是哪一個 Bot 正在存取網站?
  • 該 Bot 的存取目的為何?
  • 它是搜尋、AI 訓練還是 Agent?
  • 爬蟲是否確實遵守網站設定?

因此,當企業需要更完整的控制能力時,仍需要搭配 Bot Management、WAF、流量分析與其他網站安全機制,從網路層進一步辨識與管理自動化流量。

企業網站應該如何面對 AI 爬蟲?

AI 爬蟲的出現,並不代表企業一定需要全面封鎖所有 AI 流量。不同企業的商業模式、網站內容與數位策略不同,適合的管理方式也會有所差異。

企業可以先從以下幾個方向進行評估:

  • 盤點網站 Bot 流量:了解目前有哪些自動化流量正在存取網站。
  • 區分爬蟲用途:將 Search、Training 與 Agent 等不同用途分開思考。
  • 建立內容使用政策:依照網站內容的重要程度,定義哪些內容可以被 AI 使用。
  • 強化 Bot 管理:透過 Bot Management 與 WAF 等機制,針對異常或不符合政策的自動化流量進行控管。
  • 持續觀察流量變化:AI 爬蟲與 AI Agent 的行為仍快速演進,企業也需要持續檢視相關政策。

AI 時代,網站內容也需要更精細的治理

過去企業網站的主要目標之一,是讓搜尋引擎找到內容,進一步帶來網站流量。

但在 AI 搜尋快速發展後,使用者可能不再只是點擊搜尋結果進入網站,而是直接透過 AI 取得整理後的答案。網站內容因此可能同時面對搜尋索引、AI 摘要、模型訓練與 AI Agent 存取等不同情境。

Cloudflare 也指出,網站管理者需要的不只是「Block AI」這類單一選項,而是能夠針對不同 AI 爬蟲行為進行更細緻的控制與透明度管理。

未來網站安全除了防止惡意 Bot,也將逐步延伸至「誰可以存取、為什麼存取,以及內容如何被使用」的治理問題。

歐米英泰觀點

AI 爬蟲與 AI Agent 的快速發展,正在重新定義企業網站所面對的自動化流量。對企業而言,重點不只是要不要封鎖 AI,而是如何在網站搜尋曝光、內容使用與安全控管之間,建立符合自身需求的管理策略。

歐米英泰持續關注 Cloudflare AI、Bot Management 與網站安全技術發展,協助企業從網站流量、Bot 管理與 WAF 防護等面向建立完整的雲端安全策略,面對 AI 時代持續變化的網站流量與安全挑戰。