網站原創內容防範AI抓取的方法

|

現在已經是AI互聯網的時代,那麼網站如何保護並防範禁止原創內容被AI抓取就迫在眉睫了,因為涉及到版權利益的問題,本文提供個簡單有效的解決AI蜘蛛抓取的方法。

使用meta元素設置robots屬性。

方法一:網頁頭部添加<meta name="GPTBot" content="noindex,nofollow">。

這是用傳統常規的noindex(禁止索引)和nofollow(禁止抓取)進行限製,而GPTBot就是AI蜘蛛的UA特徵碼名稱。

方法二:網頁頭部添加<meta name="robots" content="指令值">。

示例:

<禁止AI抓取文本+圖片>

<meta name="robots" content="noai, noimageai">

<禁止文本抓取>

<meta name="robots" content="noai">

<禁止圖片抓取>

<meta name="robots" content="noimageai">

以上方法已經有OpenAI認可並支持,目前類似於通用的指令值,後續其他的AI平臺的蜘蛛有可能也會默認支持這套指令。

但是要注意這是君子協議頭,也就是不保證100%絕對的有效防範AI抓取,而是要看各家AI平臺是否遵循這套指令的限製。

另外提醒一下,robots是通用的意思,如果其他AI蜘蛛有自己的特徵碼,舉例:ClaudeBot、那麼就是name="ClaudeBot"。

結語:雖然這不能完全杜絕AI抓取,但是相比完全用訪問權限禁止就更符合SEO,所以還算是不錯的方法吧。