搜索引擎蜘蛛不抓取網站頁面的原因
我們分析網站日誌時會發現搜索引擎的蜘蛛有時候來訪很頻繁,但是就不抓取內容頁面,如果沒有經驗的SEO人員會一頭霧水,甚至會覺得是搜索引擎的問題。
其實有一大半還是網站自身存在問題,如果蜘蛛來訪頻率不低,那肯定就是內容頁面有以下這八點問題。
一、網站結構混亂堵塞。
網站結構如果是比較混亂,會造成搜索引擎的蜘蛛爬取消耗過大而放棄,尤其是內容頁面中有動態URL調用就會製造網絡堵塞的現象。
比如:網站層級過深、頁面重複率高、網站需要重複調用多級文件、動態讀取太頻繁且過深,等等。
二、內容文章太口水話。
不要爲了原創而口水原創,這是沒有意義的,如果文章大多數都是沒有絲毫價值的內容,很容易造成搜索引擎負面印象,不去碰指定的URL特徵鏈接。
比如:小幾百字的原創文章,從頭到尾就是個類似簡單的介紹,甚至題不對文,有的甚至連圖片都是盜取的。
三、網站沒有ICP備案。
如果網站沒有備案,那在國內所有搜索引擎當中都很難被抓取收錄,百度好點,這是國內政策原因,也是網絡生態的趨勢。
比如:企業網站就算是正規的,有實體公司地址,也每天保持原創更新,那也是照樣很難抓取。
四、網站訪問速度比較慢。
網站的打開訪問速度如果不理想,蜘蛛是無法完全分析頁面內容的,而且也會直接影響爬取頻率和準確性。
比如:網站打開速度需要3秒以上,頁面打開了但是資源讀取緩慢。
五、網站存在多級域名使用。
如果網站不是大品牌,而用了多個二級域名使用,這會較大的稀釋掉權重,也很容易給搜索引擎一種不靠譜和不穩定的感覺。
比如:不同靜態文件用不同的二級域名區分讀取,動態頁面又是單獨一個二級域名等等。
六、被假蜘蛛誤導和消耗資源。
現在有很多冒充搜索引擎的假蜘蛛會頻繁爬取網站頁面,輕則文章被採集,重着消耗光了服務器資源讓真蜘蛛不想來了。
比如:網站權重不是很高,又沒有主動提交URL地址,但是文章發佈後能在1小時內就有蜘蛛來爬取,而且停留時間較長。
七、網站用了CDN緩存設置不對。
CDN緩存是一把雙刃劍,很多新人不知道如何調控CDN配置,導致因為CDN廣泛的IP地址讓網站在搜索引擎那處於頻繁更新IP的問題。
比如:CDN緩存時間不合理,緩存文件丟失和異常,回源設置錯誤,等等。
八、網站存在不合格的問題。
搜索引擎對網站的考覈是比較嚴格的,隨着技術的革新會越來越嚴謹。
比如:網站採集文章、不正當手法運營和優化、作弊SEO操作、網站排版差、廣告過多,等等。
如果網站出現有蜘蛛比較頻繁的來訪,但是就不抓取收錄,就先從以上八點開始自查解決。