Archive Vol · VOL-6283

Al焚书筑梦:大模型的数据围猎

2026年7月30日 5 min read 12 次阅读

今天有个词条上热搜了——AI焚书。 由于互联网充斥着大量AI生成的“垃圾信息”,领头企业如Anthropic开始大量收购纸质旧书,尤其是2022年之前出版的作品,以确保数据的纯净度。 为了规避版权诉讼并提高效率,这些公司利用工业机械切除书脊

阅读 12
转发到

今天有个词条上热搜了——AI焚书。

由于互联网充斥着大量AI生成的“垃圾信息”,领头企业如Anthropic开始大量收购纸质旧书,尤其是2022年之前出版的作品,以确保数据的纯净度。

为了规避版权诉讼并提高效率,这些公司利用工业机械切除书脊进行高速扫描,随后将残余纸张销毁或回收。该做法被美国联邦法院裁定为合法合理使用。

这个行动,起初是秘密进行的,Anthropic内部称之为“巴拿马计划”,内部文件明确写道:“巴拿马计划是指我们破坏性扫描世界上所有书籍……我们不希望外界知道我们在做这件事。”

2024年,一些书籍的作者开始起诉Anthropic侵犯版权,“巴拿马计划”才被报道出来。

这种大规模摧毁文化遗产的行为引发了社会各界关于技术扩张与文化保护之间矛盾的激烈讨论。

这件事被报道之后,各种声讨 Anthropic 的帖子满天飞,Elon Musk 也来在回复中说,会让SpaceXAI团队用非破坏性方式扫描稀有书并保留原件,他已公开要求旗下团队改用无损扫描方式。

第一个问题:为什么非要毁掉书?

首先,这是一种规避版权风险的“法律策略”。

此前,Anthropic 因使用包含数百万册书籍的盗版“影子图书馆”(如 LibGen)训练模型而遭到集体诉讼,最终被迫支付高达 15 亿美元的天价和解金

为了合法获取书籍,Anthropic 转向了美国版权法中的“首次销售原则”(First-sale doctrine),该原则允许买家自由处置合法购买的实体书。如果扫描后保留纸质书,公司就等于拥有了两份副本,这也会有构成侵权的风险。而扫描后销毁实体书,则会被法庭认定为“极具变革性”的合理使用。因此,销毁是确保这一行为合法化的关键条件。

除了在规避版权风险,也与出于成本的考量。

从操作层面来看,“破坏性扫描”是最快、最廉价的数据提取方式。如果要在不破坏书籍装订的情况下进行扫描,需要使用昂贵的悬臂式设备、人工翻页并极其小心地操作,速度极慢。

而用工业液压裁切机切掉书脊后,书籍就变成了松散的纸页,可以送入生产级高速扫描仪,每分钟处理上百页。此外,销毁这些书籍也直接省去了为数百万本实体书支付高昂仓储费用的麻烦。

除了法律与效率,最深层的驱动力是 AI 行业正面临的数据危机。

互联网上已经被海量由 AI 自动生成的垃圾内容严重污染。如果新一代 AI 继续使用这些被污染的互联网数据进行训练,会导致其统计概率分布发生严重退化,即所谓的“模型坍塌”。

相比之下,2022年之前出版的实体书结构严密,经过了人类编辑和事实核查,能 100% 确保没有 AI 痕迹。这些旧书被 AI 公司视为不受互联网垃圾内容毒化的“纯净金矿”。

第二个问题:数据污染的趋势是无可阻挡的吗?或者说,互联网是真的会沦为废料场?

“互联网会不会沦为废料场”这个问题其实是毋庸置疑的,甚至不是未来会不会,而是当下已经是了。我之前有篇文章,专门控诉了当下中文互联网的现状,并言之凿凿的说中文互联网搜索引擎已死透。

因为要检索出真正有用的信息太费力气了。在一个信息爆炸、垃圾满天飞的环境里,找到一句人话,找到真正有价值的信息,早就成了一门手艺。

那么,数据污染的趋势是无可阻挡的吗?如果是,对我们而言又有什么样的启示呢?

数据污染的趋势确实给 AI 行业带来了严峻挑战,但要说数据污染后会彻底让大模型崩塌,这可能有点夸张。

多项研究表明,只要保留足够比例的真实人类数据、做好过滤,坍缩完全可以避免。

所以,巨头在恐慌在焚书,再囤积霸占干净语料,我们大可不必一起更着恐慌和焦虑。

最近《经济学人》对马斯克的一场90分钟专访,恰好从另一端印证了同一个判断。

记者质问马斯克,在2023年还签署过暂停前沿模型开发的公开信,为什么现在放弃了?

马斯克的回答很坦白,他当年为制衡谷歌而创办 OpenAI,结果反而加速了行业竞争。

“所有的路都通向加速,所以你要么为此难过,要么加入”。

这句话值得细品。连这个星球上最有能力踩刹车的几个人之一,都承认刹车不存在。而当被问到 AI 超越人类的范围有多大时,他连说数遍“一切”。

目前AI写代码已经强过九成的专业工程师,接上人形机器人,体力劳动同样无处退守。

从竹简到造纸,从抄写到印刷,每一次媒介更替,都有人哀叹“刀刻的才是正统,印刷的都是垃圾”。结果呢?

没有谁好谁坏,只是工具在变。AI 的普及不可逆,这一点巨头清楚、马斯克清楚、我们其实心里也清楚。与其花精力防御污染,不如思考一个真正有价值的问题。

那就是如何用AI创造出真正的价值

这才是分水岭。目前我认为一个有效的思路是,用AI做穷尽式的文献预扫描、反事实推演、跨域类比,再用自己的判断力做最终筛选与结构裁决,最终产出的是人和 AI 单独都达不到的深度。

所以我的结论很简单。

与其控诉巨头的一些离谱作为,不如思考背后的真正原因,与其担忧AI毁灭人类文明,不如思考如何驾驭好这史无前例的工具。

最后举个例子,我当前除了本职工作以外的,跟个人相关的全部操作工作流,基本都迁移到了个人数字基座上,整理材料,阅读、收藏、做笔记、撰写稿件,发布等等。

我今天更新的最大的一个功能就是,在工作流里嵌入了一个文本编辑器,因为 wordpress 自带的编辑器非常难用。

首先我用终端Grok给我检索 Github 上已经开源的最好用的文本编辑器,它给了我三个。

然后我让 Claude 分析这三个之中哪个跟我当前的系统最匹配。然后逐步构建,完善。

非常好用,当前这个文本编辑器的界面舒适感,已经超越了我最喜欢的 Ulysses 了。

所有很多功能就是一步步完善出来的,一边实践,一边应用,一边修改。所有不合理的地方,所有的 Bug 起初是看不见的,甚至很多功能是一边用一边生长出来的。

DISCUSSION

文章评论

0 条

批注针对原文,评论讨论整篇文章。所有评论都会直接发布。

    还没有评论,欢迎留下第一个想法。