搜索引擎蜘蛛的抓取和訪問的區別

|

我們習慣把搜索引擎的蜘蛛抓取和訪問視為一個意思,但是如果從嚴謹的定義去看的話,兩者是有區別的,但是作用係數又是相互形成的協同結果。

1、抓取指的是蜘蛛獲取頁面的信息、參數和屬性,包括內容和代碼的結構情況。

2、訪問指的是蜘蛛以用戶的身份角度對網站進行正常訪問,包括瀏覽體驗度和閱讀流暢性。

以百度搜索舉例,大多數都會同時有2個IP蜘蛛同時進入網站,目前常見是116和220開頭的IP,有些人當作是權重蜘蛛和抓取蜘蛛,這樣理解也是可以的。

但是其他搜索引擎大多數只有一個IP的蜘蛛,所以就很難分辨是抓取還是訪問,也是因為這點原因,很多人是不認可搜索引擎的蜘蛛是分有抓取和訪問的。

如果從技術邏輯層面去思考的話,蜘蛛應該是有訪問和抓取的區別。

我們看不到的、不表達沒有,尤其是技術層面的東西就更是無法認定有還是沒有,如果從技術邏輯的層面去細心的思考這個問題,那很大的可能性是分有訪問和抓取的工作區別。

國內大部分搜索引擎普遍存在蜘蛛過來了,但是網站內容頁面不收錄,這是算什麼呢,很大可能性只是來訪問,發現了網站內容頁面,為什麼不抓取呢,因為收錄是肯定先要抓取的。

還有一種普遍的情況就是網站內容頁面被蜘蛛訪問了,但是過段時間就會被收錄,但是這中間時段並沒有蜘蛛過來了,那這如何解釋訪問和抓取的區別,目前能解釋的是先前蜘蛛就是抓取,然後執行的是內部的模擬訪問+頁面分析+內容判斷+預存評估。

其實只要是搜索引擎的蜘蛛過來就行,不用太在意是抓取還是訪問。

不同的搜索引擎技術的蜘蛛工作方式是有區別的,不是說誰的差誰的強,只是從已經公開知道的事實就是搜索引擎會模擬用戶進行正常的瀏覽訪問,可以理解為頁面檢測診斷,否則搜索引擎如何知道已經收錄的頁面是否存在某些問題呢,用最節省資源的蜘蛛行為進行不定時的復訪。

但是SEO黑帽技術中有一項就是針對搜索引擎的蜘蛛訪問的手段,用戶訪問的是真實的廣告落地頁(A),而蜘蛛訪問的是偽造的乾淨落地頁(B),簡稱“蜘蛛訪問頁”,他的難度在於要收集沒有蜘蛛標識的IP地址進行識別區分訪問AB頁。

結語:我們不要去糾結蜘蛛是抓取還是訪問的區別,這是個長篇大論的事情,本文只是簡單介紹最基礎的對蜘蛛的看法,僅供額外的研究參考。

搜索引擎對網站內容頁面的收錄和釋放(索引)問題