注意:網站的直鏈數據是否就是AI機器人流量

|

現在有很多的網站都暴漲了直鏈接的流量,這在以前都會大多數認為是垃圾流量,但是現在要注意是否就是AI機器人流量,而且數據時間很短暫,常見的就是幾秒,像似蜘蛛,所以很多網站的安防就禁止訪問了,從而導致錯失了判斷GEO的效果。

其實現在很多AI機器人流量都是AI蜘蛛抓取造成出來的數據,所以很容易混淆,甚至偽裝起來就更難分辨清楚了,以至於現在我們都認為AI蜘蛛就是AI機器人,反之也是一樣,但是對於我們分析流量數據就比較麻煩了。

AI機器人流量是個必須要整理清楚的事情。

如果直鏈流量是確實垃圾性質,但是不破壞或消耗網站的資源,那麼不需要額外的增加防護措施,甚至也不需要禁止IP訪問,因為防不住、只能清洗,但是清洗IP流量的防護又需要投入資金成本,所以日常關注就可以了。

重點是要整理清楚是否確實是AI機器人的流量,這很有可能就是AI生成引擎的流量來源,因為不同於SEO是數據緩存、這是記錄式的點擊展示,而GEO是數據引用、這是讀取式的鏈接展覽,所以AI機器人的流量會普遍是短暫的鏈接時間。

舉例:獲知用戶需求之後,AI模型進行篩選和匹配,隨後讀取對應的URL網頁,然後驗效是否存在、符合、真實,這整個過程中會有類似於訪問了網頁,那麼就產生了鏈接的流量數據,但是又沒有特徵性的UA碼,甚至也沒有關鍵字或是長尾詞的來源,因為沒有傳遞參數,而是直接訪問了。

所以這也有個問題,我們要識別出哪些是AI機器人流量、哪些是人為點擊進入的流量,這兩個是很重要的數據分析,如果是AI機器人的流量、我們可以分析出是來源哪個AI平臺(生成引擎),如果是認為點擊的流量,那麼我們就可以側重去分析用戶需要看什麼,然後繼續加強補充。

機器人和AI的流量是有信號特徵的區別。

我們簡單的看機器人和AI的流量,兩者比較模糊,不太容易分辨,所以纔有AI機器人流量的定義,如果要追究機器人和AI的流量問題,那麼機器人通常認定是蜘蛛、而AI會被認定是平臺,但是結合起來就不能認定是平臺蜘蛛,爲了規避這個衝突矛盾的問題,現在很多互聯網服務商會有特徵碼性質的識別和屏蔽。

舉例:ChatGPT的蜘蛛是GPTBot、但是ChatGPT跳轉來源是chat.openai.com,這就可以單獨分開用於識別的信號特徵,而且現在的CDN服務商也都採取這個模式,比如說騰訊雲的EdgeOne就是通過UA特徵識別AI蜘蛛進行防護,甚至說明是機器人,從這也能知道專業廠家也是有明確的劃分,避免混淆了AI。

實際上現在技術層面還是行為方面,已經普遍的開始認定按照來源方的信號特徵,雖然蜘蛛類的特徵碼和跳轉來源都可以偽裝,但是跳轉來源的必要性比較低,所以我們可以根據機器人蜘蛛的UA特徵碼進行鍼對性的封禁,同時不需要擔憂會阻攔AI平臺的流量進入,要明白的是他們的區別,避免誤封。

AI機器人和AI蜘蛛是有本質的區別。

事實上我們大多數要防範的是AI蜘蛛,相比AI機器人,他們有本質性的區別和用途是完全不相同,我們在分析直鏈數據的時候,就要把過濾AI蜘蛛,不要納入流量數據的分析範疇,而且還要警視AI蜘蛛有可能會冒充AI機器人,為的是規避網站設置的封禁。

Microsoft Clarity有AI及機器人的儀表板。

這個應該大家都知道,可以通過Microsoft Clarity瞭解網站的機器人流量,甚至專門有AI流量數據的統計分析,而且可以單獨設置屏蔽,這其實已經說明了AI機器人的重要性和價值性,所以不要錯誤的把A機器人的流量視為垃圾,很有可能就是我們需要的AEO和GEO的流量。

而且微軟的Bing後臺已經有人工智能的數據表(AI Performance),甚至把URL檢查功能整合爲了SEO/GEO標準,所以我們要重視AI機器人的流量來源,而且要區分看待AI蜘蛛,尤其是現在還獲知不到完整的AEO和GEO的流量參數,這意味着目前很大程度是要預判流量的真實性。

如何驗證網站流量是不是AI機器人?

通常情況,任何來訪者都會有明確的入站日誌,通俗的說就是自動遞交進入的身份證標識,含有:來源IP地址--訪問日期--請求行為--HTTP請求頭--狀態碼--來源網址--客戶端環境,以下是百度GEO示例:

127.0.0.1 - - [02/Mar/2026:13:17:22 +0800] "https://www.seosiguan.com/""(跳轉來源)https://chat.baidu.com/" "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/132.0.0.0 Safari/537.36"

你可以很清晰的分段就能看出明確的身份證信息源,其實就是UA特徵標識,如果出現偽造的現象,如:採集、爬取,那就直接查驗幾個最前段的來源IP地址,只要確定有真實的生成引擎的流量來源就可以了,不需要去糾結采集和爬取的問題,因為你防不了。

結語:其實這是個有點麻煩的事情,如果你的網站被AI蜘蛛爬取消耗了大量寬帶及資源,那麼可以用CDN服務開啟禁止AI和人機識別的功能,但是這就又涉及到得失與取捨的問題,所以還是根據網站的情況進行操控。