实务指南

内容被 AI 抓取、喂进模型或生成盗用,怎么维权

更新于 · 由 VeilHarbor 内容团队整理、经事实核查 · 写给台湾、香港与海外的华语创作者 · 约 13 分钟读完 · 引用 7 个官方与权威来源

先分清三种情况,维权路径完全不同

「内容被 AI 弄了」其实是三件很不一样的事,混在一起处理只会白忙。第一种是爬取(scraping):AI 公司的爬虫把你公开的网页、图片、文字抓走,可能进了训练数据集。第二种是生成盗用:某个 AI 输出的结果直接复制或高度接近你的具体作品,或者有人用 AI 把你的内容洗一遍再当自己的卖。第三种是把你的脸、声音合成到你从未拍过的画面里——那属于合成影像,处理逻辑与举报口不同,请看deepfake 合成影像下架非自愿私密影像,本篇不重复。

分清楚的意义在于:爬取问题主要靠「事前设置」去减少(robots、平台 opt-out),它更像关门而不是维权;生成盗用问题里,只要能指认出「被复制的是你哪一件受版权保护的作品」,它就回到你熟悉的侵权下架轨道,和Google 搜索结果除名自助发 DMCA 通知是同一套工具。

怎么禁止 AI 爬你的网站(robots.txt 与平台 opt-out)

如果你有自己的网站、作品集或博客,可以在根目录的 robots.txt 文件里,针对主流 AI 爬虫的 user-agent 写禁止规则。常见的几个:OpenAI 的训练爬虫是 GPTBot;Google 用于生成式 AI 训练的控制标记是 Google-Extended(它不是独立爬虫,而是一个 robots 令牌,写了它不影响你在 Google 搜索的收录与排名);为大量模型提供训练语料的公共抓取项目是 Common Crawl 的 CCBot;Anthropic 的爬虫是 ClaudeBot。写法都是同一个模式:一行 User-agent 指明爬虫名,下一行 Disallow: / 表示整站禁止。具体、权威的爬虫名与写法以各家官方文档为准,见下方参考来源。

要诚实说清 robots.txt 的三个局限。其一,它只对「守规矩、且会读 robots」的爬虫有效,不守规矩的抓取工具照抓不误。其二,它只管未来:已经被抓走、已经喂进现有模型的内容,写了 robots 也拿不回来。其三,它只能保护「你自己控制的网站」——你发在社交平台、订阅平台、图床上的内容,由那个平台的 robots 和授权条款说了算,你改不了它们的 robots.txt。

所以第二条腿是平台层的 opt-out 设置。越来越多平台在账户或创作者后台提供「是否允许我的内容被用于 AI 训练」的开关,以及「是否允许第三方 AI 爬虫抓取」的选项。登进你常用平台的隐私 / 数据 / 创作者设置逐个检查,能关的关掉。这类设置各平台命名和位置不同、也常改版,以平台当前官方帮助中心为准。想系统盘点你在哪些地方留了内容、哪些该收紧,可以配合定期自查与反向搜索一起做。

还有一个 2026 年的新变化值得知道:如果你的网站挂在 Cloudflare 后面,Cloudflare 从 2026 年 9 月 15 日起,对新接入的网站、在带广告的页面上,默认封锁「训练(Training)」与「AI 代理(Agent)」两类爬虫(用于搜索的爬虫仍默认放行);它同时把早先的「按抓取付费」升级成「按使用付费」的机制。这类 CDN 层的封锁比 robots.txt 更有执行力——robots.txt 只是一句「请勿」、靠对方自觉,CDN 是在流量入口真的把它挡下来。但它同样只保护你自己用 Cloudflare 托管的网站,管不到你发在别人平台上的内容;而且这个默认值只覆盖新接入的域名与带广告的页面,既有站点要不要开、开到什么程度,仍得你自己进后台设定。

作品被拿去训练 AI:现实与局限(诚实版)

这是最多人问、也最没法给你一句痛快答案的部分。到 2025 年,「用受版权保护的作品训练生成式 AI 是否构成侵权、创作者能否据此索赔或要求删除」在各法域都还在演进中,没有定论。美国版权局的《著作权与人工智慧》系列报告分三部分陆续发布,其中处理「用受版权材料训练模型」的第三部分在 2025 年 5 月才发布预印版(pre-publication),结论仍属政策讨论层面;多起针对 AI 公司的训练数据诉讼也还在审理,尚未形成可以照搬的稳定规则。这意味着任何人跟你保证「能让 AI 删掉学过你的东西」都要打问号。

补充 2025 到 2026 年的走向,让你对「没有定论」有更具体的判断——但结论恐怕不乐观。这段时间已有美国法院在个别案件里,认定「拿受版权作品去训练模型」这个行为本身属于合理使用(fair use)、倾向 AI 公司一侧(Bartz 诉 Anthropic、Kadrey 诉 Meta,2025 年 6 月两案);英国法院也驳回了图库公司 Getty 对 Stability AI 的核心版权主张、仅认定极有限的商标侵权(英国高等法院 2025 年 11 月判决)。唯一真正谈成赔偿的是 Anthropic 案(Bartz v. Anthropic),以 15 亿美元和解(实际发放程序与时点仍未定)——但要看清三件事:一是它赔的是「非法下载盗版书库」那条线,不是「训练本身违法」;二是只有在美国版权局「及时登记」、且有 ISBN / ASIN 的书才够格,每册约 3,000 美元;三是认领截止日 2026 年 3 月 30 日已经过了。对绝大多数华语个体创作者来说,自己的作品既不是「书」、也没在美国登记,基本沾不上边。诚实结论:到 2026 年,「内容被拿去训练」这件事,对个人创作者来说仍然没有一条好走的维权路,别把它当成能追回损失的指望——你真正能握住的,是下一段说的那种「可指认的具体盗用」。

要区分两件事。robots.txt 和平台 opt-out 是「技术与合约层面的表态」:它能让守规矩的公司未来不再抓、也是你日后主张「我明确拒绝过」的一份记录,但它本身不是法律强制力,更不能让已训练好的模型忘掉你。而「能否事后追究、要求赔偿或删除训练数据」是「法律层面的问题」,答案随法域和个案而定,现在谁都给不了通用结论。

务实的做法是:现在能做的,是尽量减少未来被抓(设置 robots 与 opt-out)、把你「已明确拒绝授权训练」这件事留下时间戳记录、并持续留意有没有出现下一段说的「生成盗用」这种可指认的具体侵权——后者才是当下真正能推动的维权入口。以上是一般资讯整理,不构成法律意见;涉及具体索赔或诉讼,请咨询你所在法域的专业律师。

AI 生成盗用你的作品,怎么举报

当 AI 输出的结果不是「学了你的风格」,而是可辨认地复制了你某一件具体作品(整段文字、整张图、你的原创角色形象被一比一生成出来),或者有人用 AI 把你的付费内容、课程、图集洗版后散布,这就不再是模糊的训练争议,而是一般的著作权侵权,你手上的工具都能用。

第一,固定证据再动手:截图、录屏、存下网址和时间,别只是心里记着。做法见证据保全。第二,向承载侵权内容的平台发下架通知,这是最直接的一条路,写法看自助发 DMCA 通知通知—取下机制;内容出现在搜索结果里的,再走搜索引擎除名。第三,如果盗用来自某个 AI 产品本身(例如它的输出直接吐出你的受版权作品),多数正规 AI 公司都设有版权投诉 / 滥用举报入口,按它们的官方渠道提交,内容与发平台下架通知类似:指明你的原作、指明侵权处、声明你有权利。

要提交任何一条,你都得先能证明「这是你的作品」。备好创作原始档、发布时间、水印等权属证据,见证明作品归属数字水印时间戳公证。若对方是拿去做商业牟利(卖课、接单、投广告),另见未授权商业使用。查不到侵权站背后是谁、往哪里发信,用WHOIS/RDAP 查询找 abuse 联系方式

把防护常态化:三件现在就能做的事

AI 抓取和生成盗用不是一次性事件,而是持续背景噪音,靠「出事再救火」很累。三件低成本、现在就能做的事:一,把 robots.txt 和各平台 opt-out 设置一次配齐,之后每次平台改版时顺手复查。二,给你的核心作品打上可见 / 不可见水印并留好带时间戳的原始档,一旦要举报,权属证据当场就有,见数字水印。三,固定一个自查节奏,用反向图搜和关键词监控看有没有你的内容以生成盗用形式冒出来,做法见定期自查与反向搜索反向图片搜索

不确定自己该把力气放在预防、监控还是发函哪一环的,先看怎么选保护方式理清优先级。记住这篇的底线:能做的做扎实(设置、证据、对可指认的侵权发函),做不到的不硬吹(让模型忘掉你、保证清空训练数据)——诚实分清这两者,你的每一分力气才没白花。

常见问题

内容被 AI 抓取了,还救得回来吗?

要看是哪种「抓取」。如果只是被爬虫抓去可能进了训练数据,已经发生的部分基本拿不回来,robots.txt 和 opt-out 只能减少「未来」被抓。但如果是 AI 生成结果复制了你某件具体作品、或有人用 AI 洗版你的内容再散布,那属于可指认的一般侵权,能走下架通知向平台和 AI 公司举报。

怎么禁止 AI 爬我的网站?

在你自己网站根目录的 robots.txt 里,针对 AI 爬虫的 user-agent 写禁止规则,写法是一行 User-agent 指明爬虫名(如 GPTBot、CCBot),下一行 Disallow: / 表示整站禁止;Google 的训练控制用 Google-Extended 令牌。具体爬虫名与写法以各家官方文档为准。注意它只对守规矩的爬虫有效,且只管你自己控制的网站,你发在别人平台上的内容改不了那里的 robots。

写了 robots.txt,AI 就一定不抓我了吗?

不一定。robots.txt 只对「会读它、且愿意守规矩」的爬虫有约束,它不是技术强制力,不守规矩的抓取工具照抓。而且它只管未来,已经被抓走、已喂进现有模型的内容不会因此消失。把它理解成「关门并留下你明确拒绝过的记录」,而不是「保证移除」。

我的作品被拿去训练 AI,能告它、能要求删掉吗?

到目前为止,「用受版权作品训练生成式 AI 是否侵权、创作者能否据此索赔或要求删除」在各法域都还在演进,没有通用定论,相关官方报告和诉讼都还在进行中。任何保证「能让 AI 删掉学过你的东西」的说法都要存疑。涉及具体索赔请咨询你所在法域的律师;这不构成法律意见。

AI 生成的结果盗用了我的作品,该向谁举报?

两个方向同时走。一是向承载侵权内容的平台发下架通知(社交、订阅、图床、搜索结果各有入口);二是如果盗用来自某个 AI 产品本身,正规 AI 公司通常设有版权投诉 / 滥用举报渠道,按其官方入口提交。两者都需要你先固定证据并能证明作品归属。

这和 deepfake、换脸有什么区别?为什么分开讲?

deepfake 是把你的脸或声音合成到你从未参与的画面里,举报口径侧重肖像 / 人格权与私密影像保护,见 deepfake 合成影像下架和非自愿私密影像两篇。本篇讲的是你的「作品内容」被爬取训练或被生成复制,走的是著作权路径。两者证据和举报入口不同,分开处理更有效。

举报前我需要准备什么?

先固定证据:截图、录屏、存网址和时间。再备好权属证据:原始创作档、发布时间记录、水印、时间戳。查不到侵权方是谁时,用 WHOIS/RDAP 和 abuse 联系方式定位发信对象。证据和权属齐了,无论向平台还是 AI 公司提交,都能一次讲清「这是我的作品、这里是侵权、我有权利」。

参考来源

本文引用的官方与权威来源,最后核查于 2026-07-18:

developers.openai.comOpenAI 官方爬虫说明(GPTBot 与 robots.txt 设置)官方文档,列明 GPTBot 等爬虫名与在 robots.txt 禁止的写法,以及训练爬虫与搜索爬虫的区别。禁止 AI 爬取的第一手依据。 developers.google.comGoogle 爬虫总览(含 Google-Extended 训练控制令牌)Google 官方文档,说明 Google-Extended 令牌用于拒绝内容被用于训练 Gemini 等生成式 AI,并明载它不影响站点在 Google 搜索的收录与排名。 commoncrawl.orgCommon Crawl CCBot 说明与 opt-outCCBot 为大量模型提供训练语料,官方页面说明如何用 robots.txt 屏蔽 CCBot 及加入 opt-out 名单。 copyright.gov美国版权局:著作权与人工智慧专题(报告与政策)官方专题页,汇集《著作权与人工智慧》系列报告(处理训练数据的第三部分为 2025 年 5 月预印版),佐证「训练数据维权仍在演进、无定论」这一诚实说明。 tipo.gov.tw台湾经济部智慧财产局:著作权主题网台湾创作者的官方著作权入口,提供著作利用规范、争议调解与申请表单,是本地维权与咨询的权威来源。 blog.cloudflare.comCloudflare:面向所有客户的新 AI 流量选项(2026-09-15 默认封锁)Cloudflare 官方博客,说明自 2026-09-15 起对新接入域名的带广告页面默认封锁 Training / Agent 类 AI 爬虫、Search 仍放行。CDN 层封锁 AI 爬虫的第一手依据(Pay Per Use 为 Cloudflare 同期配套公告)。 authorsguild.org美国作家协会:Bartz v. Anthropic 15 亿美元和解要点权威整理 Anthropic 训练数据和解的资格与赔付:仅限美国版权局及时登记、有 ISBN/ASIN 的书,每册约 3,000 美元,认领截止 2026-03-30——佐证「训练维权对未登记的个体创作者基本无缘」这一诚实说明。
本文是实务经验的整理,不构成法律意见。个案情况(权属争议、反通知、跨境诉讼)请咨询律师。
下一步:确认你的暴露面

读完做法,不如先看看现状——输入艺名免费扫一次,不用注册,身份全程隐藏。

免费扫一次

被盗情报,不用天天自己盯

新指南与值得知道的平台规则变化,会整理成不定期的维权快讯。留下 email(化名邮箱也可以),开通时第一批通知你。不卖名单、不发垃圾信;随时可删——写信到 support@veilharbor.com 即可。

VeilHarbor——华语创作者内容保护平台:24 小时扫描盗版、DMCA 下架、追踪复发。

复制引文