實務指南

內容被 AI 抓取、喂進模型或生成盜用,怎麼維權

更新於 · 由 VeilHarbor 內容團隊整理、經事實核查 · 寫給臺灣、香港與海外的華語創作者 · 約 13 分鐘讀完 · 引用 7 個官方與權威來源

先分清三種情況,維權路徑完全不同

「內容被 AI 弄了」其實是三件很不一樣的事,混在一起處理只會白忙。第一種是爬取(scraping):AI 公司的爬蟲把你公開的網頁、圖片、文字抓走,可能進了訓練資料集。第二種是生成盜用:某個 AI 輸出的結果直接複製或高度接近你的具體作品,或者有人用 AI 把你的內容洗一遍再當自己的賣。第三種是把你的臉、聲音合成到你從未拍過的畫面裡——那屬於合成影像,處理邏輯與舉報口不同,請看deepfake 合成影像下架非自願私密影像,本篇不重複。

分清楚的意義在於:爬取問題主要靠「事前設定」去減少(robots、平臺 opt-out),它更像關門而不是維權;生成盜用問題裡,只要能指認出「被複制的是你哪一件受版權保護的作品」,它就回到你熟悉的侵權下架軌道,和Google 搜尋結果除名自助發 DMCA 通知是同一套工具。

怎麼禁止 AI 爬你的網站(robots.txt 與平臺 opt-out)

如果你有自己的網站、作品集或部落格,可以在根目錄的 robots.txt 檔案裡,針對主流 AI 爬蟲的 user-agent 寫禁止規則。常見的幾個:OpenAI 的訓練爬蟲是 GPTBot;Google 用於生成式 AI 訓練的控制標記是 Google-Extended(它不是獨立爬蟲,而是一個 robots 令牌,寫了它不影響你在 Google 搜尋的收錄與排名);為大量模型提供訓練語料的公共抓取專案是 Common Crawl 的 CCBot;Anthropic 的爬蟲是 ClaudeBot。寫法都是同一個模式:一行 User-agent 指明爬蟲名,下一行 Disallow: / 表示整站禁止。具體、權威的爬蟲名與寫法以各家官方文件為準,見下方參考來源。

要誠實說清 robots.txt 的三個侷限。其一,它只對「守規矩、且會讀 robots」的爬蟲有效,不守規矩的抓取工具照抓不誤。其二,它只管未來:已經被抓走、已經喂進現有模型的內容,寫了 robots 也拿不回來。其三,它只能保護「你自己控制的網站」——你發在社交平臺、訂閱平臺、圖床上的內容,由那個平臺的 robots 和授權條款說了算,你改不了它們的 robots.txt。

所以第二條腿是平臺層的 opt-out 設定。越來越多平臺在帳戶或創作者後臺提供「是否允許我的內容被用於 AI 訓練」的開關,以及「是否允許第三方 AI 爬蟲抓取」的選項。登進你常用平臺的隱私 / 資料 / 創作者設定逐個檢查,能關的關掉。這類設定各平臺命名和位置不同、也常改版,以平臺當前官方幫助中心為準。想系統盤點你在哪些地方留了內容、哪些該收緊,可以配合定期自查與反向搜尋一起做。

還有一個 2026 年的新變化值得知道:如果你的網站掛在 Cloudflare 後面,Cloudflare 從 2026 年 9 月 15 日起,對新接入的網站、在帶廣告的頁面上,預設封鎖「訓練(Training)」與「AI 代理(Agent)」兩類爬蟲(用於搜尋的爬蟲仍預設放行);它同時把早先的「按抓取付費」升級成「按使用付費」的機制。這類 CDN 層的封鎖比 robots.txt 更有執行力——robots.txt 只是一句「請勿」、靠對方自覺,CDN 是在流量入口真的把它擋下來。但它同樣只保護你自己用 Cloudflare 託管的網站,管不到你發在別人平臺上的內容;而且這個預設值只覆蓋新接入的域名與帶廣告的頁面,既有站點要不要開、開到什麼程度,仍得你自己進後臺設定。

作品被拿去訓練 AI:現實與侷限(誠實版)

這是最多人問、也最沒法給你一句痛快答案的部分。到 2025 年,「用受版權保護的作品訓練生成式 AI 是否構成侵權、創作者能否據此索賠或要求刪除」在各法域都還在演進中,沒有定論。美國版權局的《著作權與人工智慧》系列報告分三部分陸續發布,其中處理「用受版權材料訓練模型」的第三部分在 2025 年 5 月才發布預印版(pre-publication),結論仍屬政策討論層面;多起針對 AI 公司的訓練資料訴訟也還在審理,尚未形成可以照搬的穩定規則。這意味著任何人跟你保證「能讓 AI 刪掉學過你的東西」都要打問號。

補充 2025 到 2026 年的走向,讓你對「沒有定論」有更具體的判斷——但結論恐怕不樂觀。這段時間已有美國法院在個別案件裡,認定「拿受版權作品去訓練模型」這個行為本身屬於合理使用(fair use)、傾向 AI 公司一側(Bartz 訴 Anthropic、Kadrey 訴 Meta,2025 年 6 月兩案);英國法院也駁回了圖庫公司 Getty 對 Stability AI 的核心版權主張、僅認定極有限的商標侵權(英國高等法院 2025 年 11 月判決)。唯一真正談成賠償的是 Anthropic 案(Bartz v. Anthropic),以 15 億美元和解(實際發放程式與時點仍未定)——但要看清三件事:一是它賠的是「非法下載盜版書庫」那條線,不是「訓練本身違法」;二是只有在美國版權局「及時登記」、且有 ISBN / ASIN 的書才夠格,每冊約 3,000 美元;三是認領截止日 2026 年 3 月 30 日已經過了。對絕大多數華語個體創作者來說,自己的作品既不是「書」、也沒在美國登記,基本沾不上邊。誠實結論:到 2026 年,「內容被拿去訓練」這件事,對個人創作者來說仍然沒有一條好走的維權路,別把它當成能追回損失的指望——你真正能握住的,是下一段說的那種「可指認的具體盜用」。

要區分兩件事。robots.txt 和平臺 opt-out 是「技術與合約層面的表態」:它能讓守規矩的公司未來不再抓、也是你日後主張「我明確拒絕過」的一份記錄,但它本身不是法律強制力,更不能讓已訓練好的模型忘掉你。而「能否事後追究、要求賠償或刪除訓練資料」是「法律層面的問題」,答案隨法域和個案而定,現在誰都給不了通用結論。

務實的做法是:現在能做的,是儘量減少未來被抓(設定 robots 與 opt-out)、把你「已明確拒絕授權訓練」這件事留下時間戳記錄、並持續留意有沒有出現下一段說的「生成盜用」這種可指認的具體侵權——後者才是當下真正能推動的維權入口。以上是一般資訊整理,不構成法律意見;涉及具體索賠或訴訟,請諮詢你所在法域的專業律師。

AI 生成盜用你的作品,怎麼舉報

當 AI 輸出的結果不是「學了你的風格」,而是可辨認地複製了你某一件具體作品(整段文字、整張圖、你的原創角色形象被一比一生成出來),或者有人用 AI 把你的付費內容、課程、圖集洗版後散佈,這就不再是模糊的訓練爭議,而是一般的著作權侵權,你手上的工具都能用。

第一,固定證據再動手:截圖、錄屏、存下網址和時間,別隻是心裡記著。做法見證據保全。第二,向承載侵權內容的平臺發下架通知,這是最直接的一條路,寫法看自助發 DMCA 通知通知—取下機制;內容出現在搜尋結果裡的,再走搜尋引擎除名。第三,如果盜用來自某個 AI 產品本身(例如它的輸出直接吐出你的受版權作品),多數正規 AI 公司都設有版權投訴 / 濫用舉報入口,按它們的官方渠道提交,內容與發平臺下架通知類似:指明你的原作、指明侵權處、宣告你有權利。

要提交任何一條,你都得先能證明「這是你的作品」。備好創作原始檔、發布時間、水印等權屬證據,見證明作品歸屬數字水印時間戳公證。若對方是拿去做商業牟利(賣課、接單、投廣告),另見未授權商業使用。查不到侵權站背後是誰、往哪裡發信,用WHOIS/RDAP 查詢找 abuse 聯絡方式

把防護常態化:三件現在就能做的事

AI 抓取和生成盜用不是一次性事件,而是持續背景噪音,靠「出事再救火」很累。三件低成本、現在就能做的事:一,把 robots.txt 和各平臺 opt-out 設定一次配齊,之後每次平臺改版時順手複查。二,給你的核心作品打上可見 / 不可見水印並留好帶時間戳的原始檔,一旦要舉報,權屬證據當場就有,見數字水印。三,固定一個自查節奏,用反向圖搜和關鍵詞監控看有沒有你的內容以生成盜用形式冒出來,做法見定期自查與反向搜尋反向圖片搜尋

不確定自己該把力氣放在預防、監控還是發函哪一環的,先看怎麼選保護方式理清優先順序。記住這篇的底線:能做的做紮實(設定、證據、對可指認的侵權發函),做不到的不硬吹(讓模型忘掉你、保證清空訓練資料)——誠實分清這兩者,你的每一分力氣才沒白花。

常見問題

內容被 AI 抓取了,還救得回來嗎?

要看是哪種「抓取」。如果只是被爬蟲抓去可能進了訓練資料,已經發生的部分基本拿不回來,robots.txt 和 opt-out 只能減少「未來」被抓。但如果是 AI 生成結果複製了你某件具體作品、或有人用 AI 洗版你的內容再散佈,那屬於可指認的一般侵權,能走下架通知向平臺和 AI 公司舉報。

怎麼禁止 AI 爬我的網站?

在你自己網站根目錄的 robots.txt 裡,針對 AI 爬蟲的 user-agent 寫禁止規則,寫法是一行 User-agent 指明爬蟲名(如 GPTBot、CCBot),下一行 Disallow: / 表示整站禁止;Google 的訓練控制用 Google-Extended 令牌。具體爬蟲名與寫法以各家官方文件為準。注意它只對守規矩的爬蟲有效,且只管你自己控制的網站,你發在別人平臺上的內容改不了那裡的 robots。

寫了 robots.txt,AI 就一定不抓我了嗎?

不一定。robots.txt 只對「會讀它、且願意守規矩」的爬蟲有約束,它不是技術強制力,不守規矩的抓取工具照抓。而且它只管未來,已經被抓走、已喂進現有模型的內容不會因此消失。把它理解成「關門並留下你明確拒絕過的記錄」,而不是「保證移除」。

我的作品被拿去訓練 AI,能告它、能要求刪掉嗎?

到目前為止,「用受版權作品訓練生成式 AI 是否侵權、創作者能否據此索賠或要求刪除」在各法域都還在演進,沒有通用定論,相關官方報告和訴訟都還在進行中。任何保證「能讓 AI 刪掉學過你的東西」的說法都要存疑。涉及具體索賠請諮詢你所在法域的律師;這不構成法律意見。

AI 生成的結果盜用了我的作品,該向誰舉報?

兩個方向同時走。一是向承載侵權內容的平臺發下架通知(社交、訂閱、圖床、搜尋結果各有入口);二是如果盜用來自某個 AI 產品本身,正規 AI 公司通常設有版權投訴 / 濫用舉報渠道,按其官方入口提交。兩者都需要你先固定證據並能證明作品歸屬。

這和 deepfake、換臉有什麼區別?為什麼分開講?

deepfake 是把你的臉或聲音合成到你從未參與的畫面裡,舉報口徑側重肖像 / 人格權與私密影像保護,見 deepfake 合成影像下架和非自願私密影像兩篇。本篇講的是你的「作品內容」被爬取訓練或被生成複製,走的是著作權路徑。兩者證據和舉報入口不同,分開處理更有效。

舉報前我需要準備什麼?

先固定證據:截圖、錄屏、存網址和時間。再備好權屬證據:原始創作檔、發布時間記錄、水印、時間戳。查不到侵權方是誰時,用 WHOIS/RDAP 和 abuse 聯絡方式定位發信對象。證據和權屬齊了,無論向平臺還是 AI 公司提交,都能一次講清「這是我的作品、這裡是侵權、我有權利」。

參考來源

本文引用的官方與權威來源,最後核查於 2026-07-18:

developers.openai.comOpenAI 官方爬蟲說明(GPTBot 與 robots.txt 設定)官方文件,列明 GPTBot 等爬蟲名與在 robots.txt 禁止的寫法,以及訓練爬蟲與搜尋爬蟲的區別。禁止 AI 爬取的第一手依據。 developers.google.comGoogle 爬蟲總覽(含 Google-Extended 訓練控制令牌)Google 官方文件,說明 Google-Extended 令牌用於拒絕內容被用於訓練 Gemini 等生成式 AI,並明載它不影響站點在 Google 搜尋的收錄與排名。 commoncrawl.orgCommon Crawl CCBot 說明與 opt-outCCBot 為大量模型提供訓練語料,官方頁面說明如何用 robots.txt 遮蔽 CCBot 及加入 opt-out 名單。 copyright.gov美國版權局:著作權與人工智慧專題(報告與政策)官方專題頁,彙集《著作權與人工智慧》系列報告(處理訓練資料的第三部分為 2025 年 5 月預印版),佐證「訓練資料維權仍在演進、無定論」這一誠實說明。 tipo.gov.tw臺灣經濟部智慧財產局:著作權主題網臺灣創作者的官方著作權入口,提供著作利用規範、爭議調解與申請表單,是本地維權與諮詢的權威來源。 blog.cloudflare.comCloudflare:面向所有客戶的新 AI 流量選項(2026-09-15 預設封鎖)Cloudflare 官方部落格,說明自 2026-09-15 起對新接入域名的帶廣告頁面預設封鎖 Training / Agent 類 AI 爬蟲、Search 仍放行。CDN 層封鎖 AI 爬蟲的第一手依據(Pay Per Use 為 Cloudflare 同期配套公告)。 authorsguild.org美國作家協會:Bartz v. Anthropic 15 億美元和解要點權威整理 Anthropic 訓練資料和解的資格與賠付:僅限美國版權局及時登記、有 ISBN/ASIN 的書,每冊約 3,000 美元,認領截止 2026-03-30——佐證「訓練維權對未登記的個體創作者基本無緣」這一誠實說明。
本文是實務經驗的整理,不構成法律意見。個案情況(權屬爭議、反通知、跨境訴訟)請諮詢律師。
下一步:確認你的暴露面

讀完做法,不如先看看現狀——輸入藝名免費掃一次,不用註冊,身分全程隱藏。

免費掃一次

被盜情報,不用天天自己盯

新指南與值得知道的平臺規則變化,會整理成不定期的維權快訊。留下 email(化名信箱也可以),開通時第一批通知你。不賣名單、不發垃圾信;隨時可刪——寫信到 support@veilharbor.com 即可。

VeilHarbor——華語創作者內容保護平台:24 小時掃描盜版、DMCA 下架、追蹤復發。

複製引文