先分清三種情況,維權路徑完全不同
「內容被 AI 弄了」其實是三件很不一樣的事,混在一起處理只會白忙。第一種是爬取(scraping):AI 公司的爬蟲把你公開的網頁、圖片、文字抓走,可能進了訓練資料集。第二種是生成盜用:某個 AI 輸出的結果直接複製或高度接近你的具體作品,或者有人用 AI 把你的內容洗一遍再當自己的賣。第三種是把你的臉、聲音合成到你從未拍過的畫面裡——那屬於合成影像,處理邏輯與舉報口不同,請看deepfake 合成影像下架與非自願私密影像,本篇不重複。
分清楚的意義在於:爬取問題主要靠「事前設定」去減少(robots、平臺 opt-out),它更像關門而不是維權;生成盜用問題裡,只要能指認出「被複制的是你哪一件受版權保護的作品」,它就回到你熟悉的侵權下架軌道,和Google 搜尋結果除名、自助發 DMCA 通知是同一套工具。
怎麼禁止 AI 爬你的網站(robots.txt 與平臺 opt-out)
如果你有自己的網站、作品集或部落格,可以在根目錄的 robots.txt 檔案裡,針對主流 AI 爬蟲的 user-agent 寫禁止規則。常見的幾個:OpenAI 的訓練爬蟲是 GPTBot;Google 用於生成式 AI 訓練的控制標記是 Google-Extended(它不是獨立爬蟲,而是一個 robots 令牌,寫了它不影響你在 Google 搜尋的收錄與排名);為大量模型提供訓練語料的公共抓取專案是 Common Crawl 的 CCBot;Anthropic 的爬蟲是 ClaudeBot。寫法都是同一個模式:一行 User-agent 指明爬蟲名,下一行 Disallow: / 表示整站禁止。具體、權威的爬蟲名與寫法以各家官方文件為準,見下方參考來源。
要誠實說清 robots.txt 的三個侷限。其一,它只對「守規矩、且會讀 robots」的爬蟲有效,不守規矩的抓取工具照抓不誤。其二,它只管未來:已經被抓走、已經喂進現有模型的內容,寫了 robots 也拿不回來。其三,它只能保護「你自己控制的網站」——你發在社交平臺、訂閱平臺、圖床上的內容,由那個平臺的 robots 和授權條款說了算,你改不了它們的 robots.txt。
所以第二條腿是平臺層的 opt-out 設定。越來越多平臺在帳戶或創作者後臺提供「是否允許我的內容被用於 AI 訓練」的開關,以及「是否允許第三方 AI 爬蟲抓取」的選項。登進你常用平臺的隱私 / 資料 / 創作者設定逐個檢查,能關的關掉。這類設定各平臺命名和位置不同、也常改版,以平臺當前官方幫助中心為準。想系統盤點你在哪些地方留了內容、哪些該收緊,可以配合定期自查與反向搜尋一起做。
還有一個 2026 年的新變化值得知道:如果你的網站掛在 Cloudflare 後面,Cloudflare 從 2026 年 9 月 15 日起,對新接入的網站、在帶廣告的頁面上,預設封鎖「訓練(Training)」與「AI 代理(Agent)」兩類爬蟲(用於搜尋的爬蟲仍預設放行);它同時把早先的「按抓取付費」升級成「按使用付費」的機制。這類 CDN 層的封鎖比 robots.txt 更有執行力——robots.txt 只是一句「請勿」、靠對方自覺,CDN 是在流量入口真的把它擋下來。但它同樣只保護你自己用 Cloudflare 託管的網站,管不到你發在別人平臺上的內容;而且這個預設值只覆蓋新接入的域名與帶廣告的頁面,既有站點要不要開、開到什麼程度,仍得你自己進後臺設定。
作品被拿去訓練 AI:現實與侷限(誠實版)
這是最多人問、也最沒法給你一句痛快答案的部分。到 2025 年,「用受版權保護的作品訓練生成式 AI 是否構成侵權、創作者能否據此索賠或要求刪除」在各法域都還在演進中,沒有定論。美國版權局的《著作權與人工智慧》系列報告分三部分陸續發布,其中處理「用受版權材料訓練模型」的第三部分在 2025 年 5 月才發布預印版(pre-publication),結論仍屬政策討論層面;多起針對 AI 公司的訓練資料訴訟也還在審理,尚未形成可以照搬的穩定規則。這意味著任何人跟你保證「能讓 AI 刪掉學過你的東西」都要打問號。
補充 2025 到 2026 年的走向,讓你對「沒有定論」有更具體的判斷——但結論恐怕不樂觀。這段時間已有美國法院在個別案件裡,認定「拿受版權作品去訓練模型」這個行為本身屬於合理使用(fair use)、傾向 AI 公司一側(Bartz 訴 Anthropic、Kadrey 訴 Meta,2025 年 6 月兩案);英國法院也駁回了圖庫公司 Getty 對 Stability AI 的核心版權主張、僅認定極有限的商標侵權(英國高等法院 2025 年 11 月判決)。唯一真正談成賠償的是 Anthropic 案(Bartz v. Anthropic),以 15 億美元和解(實際發放程式與時點仍未定)——但要看清三件事:一是它賠的是「非法下載盜版書庫」那條線,不是「訓練本身違法」;二是只有在美國版權局「及時登記」、且有 ISBN / ASIN 的書才夠格,每冊約 3,000 美元;三是認領截止日 2026 年 3 月 30 日已經過了。對絕大多數華語個體創作者來說,自己的作品既不是「書」、也沒在美國登記,基本沾不上邊。誠實結論:到 2026 年,「內容被拿去訓練」這件事,對個人創作者來說仍然沒有一條好走的維權路,別把它當成能追回損失的指望——你真正能握住的,是下一段說的那種「可指認的具體盜用」。
要區分兩件事。robots.txt 和平臺 opt-out 是「技術與合約層面的表態」:它能讓守規矩的公司未來不再抓、也是你日後主張「我明確拒絕過」的一份記錄,但它本身不是法律強制力,更不能讓已訓練好的模型忘掉你。而「能否事後追究、要求賠償或刪除訓練資料」是「法律層面的問題」,答案隨法域和個案而定,現在誰都給不了通用結論。
務實的做法是:現在能做的,是儘量減少未來被抓(設定 robots 與 opt-out)、把你「已明確拒絕授權訓練」這件事留下時間戳記錄、並持續留意有沒有出現下一段說的「生成盜用」這種可指認的具體侵權——後者才是當下真正能推動的維權入口。以上是一般資訊整理,不構成法律意見;涉及具體索賠或訴訟,請諮詢你所在法域的專業律師。
AI 生成盜用你的作品,怎麼舉報
當 AI 輸出的結果不是「學了你的風格」,而是可辨認地複製了你某一件具體作品(整段文字、整張圖、你的原創角色形象被一比一生成出來),或者有人用 AI 把你的付費內容、課程、圖集洗版後散佈,這就不再是模糊的訓練爭議,而是一般的著作權侵權,你手上的工具都能用。
第一,固定證據再動手:截圖、錄屏、存下網址和時間,別隻是心裡記著。做法見證據保全。第二,向承載侵權內容的平臺發下架通知,這是最直接的一條路,寫法看自助發 DMCA 通知與通知—取下機制;內容出現在搜尋結果裡的,再走搜尋引擎除名。第三,如果盜用來自某個 AI 產品本身(例如它的輸出直接吐出你的受版權作品),多數正規 AI 公司都設有版權投訴 / 濫用舉報入口,按它們的官方渠道提交,內容與發平臺下架通知類似:指明你的原作、指明侵權處、宣告你有權利。
要提交任何一條,你都得先能證明「這是你的作品」。備好創作原始檔、發布時間、水印等權屬證據,見證明作品歸屬、數字水印與時間戳公證。若對方是拿去做商業牟利(賣課、接單、投廣告),另見未授權商業使用。查不到侵權站背後是誰、往哪裡發信,用WHOIS/RDAP 查詢與找 abuse 聯絡方式。
把防護常態化:三件現在就能做的事
AI 抓取和生成盜用不是一次性事件,而是持續背景噪音,靠「出事再救火」很累。三件低成本、現在就能做的事:一,把 robots.txt 和各平臺 opt-out 設定一次配齊,之後每次平臺改版時順手複查。二,給你的核心作品打上可見 / 不可見水印並留好帶時間戳的原始檔,一旦要舉報,權屬證據當場就有,見數字水印。三,固定一個自查節奏,用反向圖搜和關鍵詞監控看有沒有你的內容以生成盜用形式冒出來,做法見定期自查與反向搜尋與反向圖片搜尋。
不確定自己該把力氣放在預防、監控還是發函哪一環的,先看怎麼選保護方式理清優先順序。記住這篇的底線:能做的做紮實(設定、證據、對可指認的侵權發函),做不到的不硬吹(讓模型忘掉你、保證清空訓練資料)——誠實分清這兩者,你的每一分力氣才沒白花。
常見問題
要看是哪種「抓取」。如果只是被爬蟲抓去可能進了訓練資料,已經發生的部分基本拿不回來,robots.txt 和 opt-out 只能減少「未來」被抓。但如果是 AI 生成結果複製了你某件具體作品、或有人用 AI 洗版你的內容再散佈,那屬於可指認的一般侵權,能走下架通知向平臺和 AI 公司舉報。
在你自己網站根目錄的 robots.txt 裡,針對 AI 爬蟲的 user-agent 寫禁止規則,寫法是一行 User-agent 指明爬蟲名(如 GPTBot、CCBot),下一行 Disallow: / 表示整站禁止;Google 的訓練控制用 Google-Extended 令牌。具體爬蟲名與寫法以各家官方文件為準。注意它只對守規矩的爬蟲有效,且只管你自己控制的網站,你發在別人平臺上的內容改不了那裡的 robots。
不一定。robots.txt 只對「會讀它、且願意守規矩」的爬蟲有約束,它不是技術強制力,不守規矩的抓取工具照抓。而且它只管未來,已經被抓走、已喂進現有模型的內容不會因此消失。把它理解成「關門並留下你明確拒絕過的記錄」,而不是「保證移除」。
到目前為止,「用受版權作品訓練生成式 AI 是否侵權、創作者能否據此索賠或要求刪除」在各法域都還在演進,沒有通用定論,相關官方報告和訴訟都還在進行中。任何保證「能讓 AI 刪掉學過你的東西」的說法都要存疑。涉及具體索賠請諮詢你所在法域的律師;這不構成法律意見。
兩個方向同時走。一是向承載侵權內容的平臺發下架通知(社交、訂閱、圖床、搜尋結果各有入口);二是如果盜用來自某個 AI 產品本身,正規 AI 公司通常設有版權投訴 / 濫用舉報渠道,按其官方入口提交。兩者都需要你先固定證據並能證明作品歸屬。
deepfake 是把你的臉或聲音合成到你從未參與的畫面裡,舉報口徑側重肖像 / 人格權與私密影像保護,見 deepfake 合成影像下架和非自願私密影像兩篇。本篇講的是你的「作品內容」被爬取訓練或被生成複製,走的是著作權路徑。兩者證據和舉報入口不同,分開處理更有效。
先固定證據:截圖、錄屏、存網址和時間。再備好權屬證據:原始創作檔、發布時間記錄、水印、時間戳。查不到侵權方是誰時,用 WHOIS/RDAP 和 abuse 聯絡方式定位發信對象。證據和權屬齊了,無論向平臺還是 AI 公司提交,都能一次講清「這是我的作品、這裡是侵權、我有權利」。
參考來源
本文引用的官方與權威來源,最後核查於 2026-07-18:
讀完做法,不如先看看現狀——輸入藝名免費掃一次,不用註冊,身分全程隱藏。
被盜情報,不用天天自己盯
新指南與值得知道的平臺規則變化,會整理成不定期的維權快訊。留下 email(化名信箱也可以),開通時第一批通知你。不賣名單、不發垃圾信;隨時可刪——寫信到 support@veilharbor.com 即可。
VeilHarbor——華語創作者內容保護平台:24 小時掃描盜版、DMCA 下架、追蹤復發。