冒充搜素引擎的假蜘蛛IP對網站爬取的跡象原因
假蜘蛛也就是冒充搜索引擎蜘蛛爬取網站,可以通過網站日誌分析出來,國內最常見的就是冒充百度蜘蛛,大部分網站都存在假蜘蛛爬取的行為,而且是每天頻繁來訪爬取,這就給我們帶來一些困惑,尤其是新人站長更是搞不清楚狀況,如果網站處於較高頻率的原創文章發佈,這就需要我們警惕了。
我們可以通過以下這幾點判斷出假蜘蛛和爬取路徑。
一、檢測蜘蛛的IP真偽來訪目的
通過分析IP地址和UA標識判斷哪些是假蜘蛛,爬取是否正常,是否喜歡去一些現在權限的文件和一些不存在的文件路徑,尤其是直接爬取其他常見的網站隱私文件(比如你的網站沒有ABC文件,但就是爬取ABC文件),真蜘蛛是不會這樣爬取的。
二、檢查蜘蛛爬取的路徑
搜索引擎蜘蛛會比較遵守robots協議文件,偶爾會超過屏蔽限製,但是假蜘蛛會無視robots協議文件胡亂爬取,最明顯的特徵是經常爬取網站程序路徑、非本站程序路徑文件、壓縮文件、文檔、等其他比較敏感的文件和路徑。
三、診斷蜘蛛抓取的特徵
假蜘蛛很明顯有個特徵就是很喜歡隱私和機密文件,以文件後綴和常規壓縮名稱爲準,這種行為就是想盜取下載網站的資源,有的甚至喜歡往數據相關的文件裏面爬,這也是想獲知網站信息進行後續的攻擊行為,同時還要注意一些符合和加密解密的抓取特徵。
冒充搜索引擎蜘蛛對網站的爬取都不是好事,輕者想盜取網站有價值的內容,比如原創文章,重者就是想獲取網站的信息和數據進行攻擊和篡改。
如果你的網站和服務器沒有比較大的安全問題和漏洞,可以無視假蜘蛛的爬取,不建議憑個人感覺去屏蔽假蜘蛛IP,因為搜索引擎的蜘蛛IP從安全層面考慮有些是檢測不到的,存在新IP使用和臨時IP使用的情況,所以要避免誤判把真蜘蛛屏蔽了。
如何解決網站被假蜘蛛爬取的危害風險
1、設置好網站權限和安全,加固服務器配置和參數,整理淨化網站文件,不要留存不必要的文件,關閉下載屬性,限製網絡速率和峰值,在保障搜索引擎蜘蛛和訪客正常來訪的情況下,對不正常的訪問現象進行合理的防範措施,這樣可以降低假蜘蛛對網站造成的傷害。
2、也可以檢測假蜘蛛IP是哪個地區的,如果是國內IP冒充百度搜索,可以直接向百度提交諮詢工單確認,如果不是就直接屏蔽,如果是國外IP,就要考慮網站是否運營國外市場,否則就屏蔽IP。(這條不建議優先採用,除非假蜘蛛太多, 影響到網站正常運營。)
如果想徹底完全的解決假蜘蛛的爬取是很難的,需要很強的技術和資源,而且也無法避免的,尤其是國內奉行的是伸手即拿的風氣更是猖狂,所以做好基礎的安全防範措施,心態放好,保護好網站資源和信息,不用太糾結和擔憂假蜘蛛的問題。