防止網站原創文章被採集抄襲的小方法

|

採集抄襲和偽原創已經成為一種產業,那就必然有高手在其中投入技術解決如何從外部網站爬取文章進行採集抄襲,加工偽原創,下麪我們說說一些小方法,但不能保證百分百杜絕被抄襲。

一,文章進行加密

文章加密需要較強的技術能力,通過對文章內容的加密形成亂碼讓採集方無法爬取,但是這需要完全瞭解搜索引擎和瀏覽器的解密機制,不然會導致無法抓取和顯示,出現亂碼。

這種方式最保險,破解成本高,對網站技術要求高。

二,文章包裝在JS內

文章包裝在JS內對搜索引擎不太友好,只限於高權重的權威站點,因為搜索引擎不會對所有網站的js包裝的文章進行解析爬取。

這種方式適合閉環私域流量的網站,對搜索引擎依賴性較少的可以採用。

三,網站首頁和欄目更新延後

大部分採集都是通過網站的首頁和欄目進行抓取分析是否有新URL鏈接,然後進行爬取採集,如果網站原創更新頻率較高也會被採集方設置為優先級,所以每次網站發佈新文章後不要馬上在首頁和欄目頁進行更新,先像搜索引擎提交鏈接,24小時後在進行網站更新,這樣是不會耽擱網站的,可以較大程度降低被採集後對網站造成SEO影響。

這種方式是最簡單的,防採集影響也還行,如果是新站,目的是告知搜索引擎你的網站運營態度,如果是有權重的網站,基本上24小時內會收錄。網站更新文章主要的目的還是增加權重和獲取流量嘛。

四,設置IP訪問頻率機制

採集通常都是用工具或者採集,主要特徵就是要爬取掃描,其中就要模擬點擊翻頁,這套流量下來會出現IP訪問頻率比較高,從用戶角度是不可能出現這種情況的,所以在服務器端可以設置對IP的管控,比如高頻率IP訪問要進行驗證碼。

這種方式要對搜索引擎的爬蟲IP進行放行,避免誤驗搜索引擎的IP導致網站不被收錄。

五,UA響應頭限製

通過UA響應頭可以判斷網站被訪問來源等等,所以也可以使用UA響應頭禁止不正常訪問,過濾參數等等。

這種方式也要對搜索引擎進行放行,避免禁止搜索引擎的UA響應。

六,開啟HTTPS雙向認證

HTTPS雙向認證會對客戶端進行加密驗證,利用這一點可以削弱採集方的能力,因為大部分採集工具爲了提高效率、降低開發和運營成本,對HTTPS雙向認證的網站比較慎重。

這種方式主要是提高對方採集不穩定性,擾亂對方採集時的結果。

以上5中方式不能100%保證文章不會被採集,但是會加大採集者的難度,造成對方成本增加而放棄採集。