天天把人类命运挂嘴边的A社,刚为盗版书赔了15亿美元,还毁书灭迹?

温故智新AIGC实验室

TL;DR:

自称AI安全先锋的Anthropic,因用盗版书训练模型被罚15亿美元,几乎赔掉两年营收。更离谱的是,它为了让训练“合规”,买来纸质书切碎扫描,可能顺手毁掉了人类最后的孤本。这波操作不仅砍到自己大动脉,还给整个AI行业打了个样:版权费,早掏早超生。

要说AI圈里谁最爱把“人类命运”挂嘴边,Anthropic绝对排第一。从AGI风险到AI安全,口号喊得震天响,一副要替全人类把关的架势。

结果呢?最近一纸判决,直接把老底掀了。

今年7月20号,拉扯了快两年的Anthropic盗版书集体诉讼案终于尘埃落定。法院批准和解,Anthropic得乖乖掏出 15亿美元 天价和解金1。这数有多夸张?路透社之前报道,它2023到2025年两年营收加起来也才50亿1——这一刀,真真切切砍在了大动脉上。连马斯克都没忍住,跑出来踩了一脚2

事情还得从Anthropic自己递出去的刀子说起。

2021年底,Anthropic发表了一篇论文,详细介绍早期大模型的训练数据来源,里面提到了一个叫“The Pile”的数据集,以及它的子集“Books3”——包含了近20万本盗版电子书3。当时还算学术研究,版权方先记在小本本上。

但到了2024年,媒体发起大调查,追问之下Anthropic发言人承认:商业模型Claude确实用了包含盗版内容的The Pile进行训练4。这下版权方彻底怒了:“你用我作品训练赚钱,还想抢我饭碗,我一分拿不到?”三位作家代表数十万版权人,直接A了上去4

等正式立案,原告获得深入调查的机会,结果发现更刺激的:除了Books3,Anthropic还用了LibGen、PiLiMi等盗版书库,加起来 超过700万本书,全是非法下载4

这还不算完。Anthropic早就知道自己脚底有泥,于是干了一件让人目瞪口呆的事——买纸质书,切碎了扫描入库,然后销毁纸书。

是的,物理意义上把书切成一摞摞纸页,塞进扫描机。

这个操作在法律上完美合规:根据美国版权法的“首次销售原则”,你买了书之后随便处置,只要不扩散新副本。所以它合法,但槽点直接拉满——且不说这些书里很可能有珍稀孤本、绝版书、外语书,你一刀下去,等于从物理世界彻底抹除了这些知识。二手书商都急了:“我库存里有些书,可能就是目前流通的最后几本了!”4

更讽刺的是,这个“合法操作”恰恰向法官证明了:Anthropic你小子是懂版权法的啊。你清楚怎么规避风险,那之前用盗版就是明知故犯,罪加一等5

社交平台上瞬间炸锅,相关帖子浏览量破两千万,骂了快四千楼2。专家学者带头谴责,马斯克直接在评论区开火,“知识垄断商”的帽子扣得死死的2

Anthropic这回真是赔了钱又丢了脸。

但在这场天价官司里,赚得最狠的居然是原告律师。按协议,律师要收和解金的20%——整整3亿美元。连法院都觉得过分,给砍到了1亿。但1亿啊,一场官司赚到你一辈子没见过的那种钱5。只能说:当律师,真好(确信)。

话又说回来,这个案子的推进速度远超行业预期。没有长期拉锯,没有偏袒巨头,法院果断点头和解,先让大家拿钱再说。这给所有悬而未决的AI版权案打了个样——别拖,拖久了对谁都没好处5

当然,15亿不会是Anthropic为版权花的最后一笔。放弃集体诉讼的版权方还在单独和它打官司。AI与版权的争议,远没结束。

AI到底能不能不打招呼就拿真人作品训练?生成的内容复刻了真人风格算不算侵权?责任算谁的?这些问题,恐怕比AGI还难解。

所以,比起那些远在天边的“超级智能”和“人类长期福祉”,不如先摸摸良心,把眼前这些版权纠纷理清楚。

否则,连法律这一关都过不去,还谈什么拯救人类?