TL;DR:
AI巨头为了搞到“干净”的训练数据,居然把珍贵的纸质书买回来切掉书脊、扫描,然后直接销毁。马斯克看到这新闻,赶紧跳出来说自家的SpaceXAI用的是无损扫描,书不会坏。这波操作,到底是良心发现还是公关危机?
惨案现场:AI公司买书到底有多“暴力”?
你可能以为AI训练数据只是从网上扒拉点文字、图片,但最近独立媒体404 Media的一则报道,直接把AI巨头们的“黑历史”掀了个底朝天——它们竟然在批量购买2022年前出版的实体书,然后用液压切割机切掉书脊,快速扫描,扫完就直接粉碎销毁。1
为什么要这么暴力?因为这些AI公司需要的是“干净数据”——也就是2022年之前由人类原创、没有被AI生成内容“污染”的语料。在大模型训练里,“干净语料”已经成了稀缺资源,纸质书就成了香饽饽。特别是那些存世量极少的绝版古籍,也被卷入这场“数据掠夺”之中。
报道特别点名了Anthropic(就是开发Claude的那家公司),说它们搞了个代号叫“巴拿马计划”的行动,销毁了数百万册实体书。更让人震惊的是,美国联邦法院居然判定这种行为合法:只要你合法买下纸质书,再把它破坏性扫描用于AI训练,就属于“合理使用”。1
好家伙,这哪里是“合理使用”,这分明是“合理毁书”啊!
马斯克出手:SpaceXAI做“无损扫描”,是公关还是良心?
报道在社交媒体上一发酵,迅速引起热议。X平台账号Hedgie转述了这件事,没想到马斯克亲自下场回复了:
“已经要求SpaceXAI团队保存图书馆中所有珍贵的书籍,并采用无损扫描方式,从而避免破坏书脊。”1
Hedgie立马点赞:“感谢马斯克团队这样做,虽然扫描速度慢一些,但你们仍然可以获得训练数据。如果SpaceXAI能够坚持这样做,那么其他业内公司也应该以此为标准。”
啧啧,马斯克这反应速度,堪称“吃瓜第一线”。不过仔细想想,SpaceXAI本来就没被卷入“毁书门”,这波表态更像是在树立“业界良心”人设。但是不管怎么说,至少给这场“暴力扫描”提供了另一个选项——慢一点,但书不会受伤。
背后逻辑:为什么书籍成了AI的“唐僧肉”?
你可能要问:既然网上有那么多文本数据,为啥还要费力去扫实体书?
答案是:AI生成内容正在以指数级速度涌入互联网。如果直接用这些数据训练新模型,就会产生“自噬”效应——模型越学越像自己,质量下降,创新能力变差。而2022年前出版的图书,基本没有AI参与创作,是真正的“人类纯净语料”。
于是,书籍变成了AI巨头的“唐僧肉”。ISBNdb这家公司号称拥有“全球最大的图书数据库”,近年已经转型为AI企业的“图书数据供应商”。《华盛顿邮报》还发现,Anthropic与旧书平台Better World Books建立了合作,专门收购图书馆和个人的旧书。1
看来,纸质书不仅没有被数字时代淘汰,反而成了AI军备竞赛中的战略物资。
法律战场:出版商 vs AI巨头,谁更占理?
当然,出版商们也不是吃素的。眼看着自己的内容被拿去训练对手(AI),他们纷纷拿起法律武器。
就在7月,新闻集团(News Corp)在加州起诉搜索引擎公司Brave Software,指控其未经授权抓取《华尔街日报》《纽约邮报》的文章用于AI训练。1
同样在7月,一群主要出版商起诉谷歌,称其非法使用数百万本受版权保护的书籍来构建Gemini AI模型,这被称为“历史上最严重的侵犯版权行为之一”。谷歌内部评估,如果这些文本被用于Google Play图书,公司可能面临100亿至1000亿美元的潜在罚款。1
一个有意思的点是:虽然“买书销毁”被法院认定为合法,但直接抓取网络内容反而惹上官司。法律的天平,似乎在实体和数字之间摇摆不定。
不过,对于出版业来说,这未必全是坏事。中信证券研报指出,预计2026年文化IP数字化运营有望为出版业带来约700亿元增量空间。大模型训练对优质语料的需求,反而让出版企业的内容资产价值凸显。1 中泰证券也表示,相关出版公司版权归属清晰,有望跨越多个技术周期,成为底层核心资产。
所以,书籍的“被需要”感,其实是AI时代给传统出版业的一张新船票。
一点思考
当AI开始“吃书”训练自己,我们不得不思考:技术的进步,究竟该不该以文化载体的牺牲为代价?马斯克的“无损扫描”提供了一个折中方案,但效率问题又摆在那里。在“干净数据”越来越贵的未来,也许合成数据技术才是最终的答案——不过那是另一个故事了。
至少现在,让我们对那些还没被切掉书脊的书籍,多一些敬意吧。