TL;DR:
自称AI安全先锋的Anthropic,因用盗版书训练模型被罚15亿美元,几乎赔掉两年营收。更离谱的是,它为了让训练“合规”,买来纸质书切碎扫描,可能顺手毁掉了人类最后的孤本。这波操作不仅砍到自己大动脉,还给整个AI行业打了个样:版权费,早掏早超生。
要说AI圈里谁最爱把“人类命运”挂嘴边,Anthropic绝对排第一。从AGI风险到AI安全,口号喊得震天响,一副要替全人类把关的架势。
结果呢?最近一纸判决,直接把老底掀了。
今年7月20号,拉扯了快两年的Anthropic盗版书集体诉讼案终于尘埃落定。法院批准和解,Anthropic得乖乖掏出 15亿美元 天价和解金1。这数有多夸张?路透社之前报道,它2023到2025年两年营收加起来也才50亿1——这一刀,真真切切砍在了大动脉上。连马斯克都没忍住,跑出来踩了一脚2。
事情还得从Anthropic自己递出去的刀子说起。
2021年底,Anthropic发表了一篇论文,详细介绍早期大模型的训练数据来源,里面提到了一个叫“The Pile”的数据集,以及它的子集“Books3”——包含了近20万本盗版电子书3。当时还算学术研究,版权方先记在小本本上。
但到了2024年,媒体发起大调查,追问之下Anthropic发言人承认:商业模型Claude确实用了包含盗版内容的The Pile进行训练4。这下版权方彻底怒了:“你用我作品训练赚钱,还想抢我饭碗,我一分拿不到?”三位作家代表数十万版权人,直接A了上去4。
等正式立案,原告获得深入调查的机会,结果发现更刺激的:除了Books3,Anthropic还用了LibGen、PiLiMi等盗版书库,加起来 超过700万本书,全是非法下载4。
这还不算完。Anthropic早就知道自己脚底有泥,于是干了一件让人目瞪口呆的事——买纸质书,切碎了扫描入库,然后销毁纸书。
是的,物理意义上把书切成一摞摞纸页,塞进扫描机。
这个操作在法律上完美合规:根据美国版权法的“首次销售原则”,你买了书之后随便处置,只要不扩散新副本。所以它合法,但槽点直接拉满——且不说这些书里很可能有珍稀孤本、绝版书、外语书,你一刀下去,等于从物理世界彻底抹除了这些知识。二手书商都急了:“我库存里有些书,可能就是目前流通的最后几本了!”4
更讽刺的是,这个“合法操作”恰恰向法官证明了:Anthropic你小子是懂版权法的啊。你清楚怎么规避风险,那之前用盗版就是明知故犯,罪加一等5。
社交平台上瞬间炸锅,相关帖子浏览量破两千万,骂了快四千楼2。专家学者带头谴责,马斯克直接在评论区开火,“知识垄断商”的帽子扣得死死的2。
Anthropic这回真是赔了钱又丢了脸。
但在这场天价官司里,赚得最狠的居然是原告律师。按协议,律师要收和解金的20%——整整3亿美元。连法院都觉得过分,给砍到了1亿。但1亿啊,一场官司赚到你一辈子没见过的那种钱5。只能说:当律师,真好(确信)。
话又说回来,这个案子的推进速度远超行业预期。没有长期拉锯,没有偏袒巨头,法院果断点头和解,先让大家拿钱再说。这给所有悬而未决的AI版权案打了个样——别拖,拖久了对谁都没好处5。
当然,15亿不会是Anthropic为版权花的最后一笔。放弃集体诉讼的版权方还在单独和它打官司。AI与版权的争议,远没结束。
AI到底能不能不打招呼就拿真人作品训练?生成的内容复刻了真人风格算不算侵权?责任算谁的?这些问题,恐怕比AGI还难解。
所以,比起那些远在天边的“超级智能”和“人类长期福祉”,不如先摸摸良心,把眼前这些版权纠纷理清楚。
否则,连法律这一关都过不去,还谈什么拯救人类?
-
路透社:Anthropic两年营收仅50亿美元 · 检索日期2026-07-30 ↩︎ ↩︎
-
马斯克在X平台评论Anthropic盗版书案 · 检索日期2026-07-30 ↩︎ ↩︎ ↩︎
-
Anthropic论文:训练数据来源与Books3 · 检索日期2026-07-30 ↩︎
-
404 Media调查:Anthropic使用盗版书训练Claude · 检索日期2026-07-30 ↩︎ ↩︎ ↩︎ ↩︎
-
美国加州北区法院判决书:Anthropic集体诉讼和解 · 检索日期2026-07-30 ↩︎ ↩︎ ↩︎