当今网络世界,AI生成的内容已超过半数,优质的文字内容变得极为珍贵。
一些AI企业与中介合作,大量购买二手图书,扫描后再行销毁,目的是获得2022年以前未接触过机器的原始训练数据。Anthropic公司的“巴拿马计划”揭露了这一暗藏的产业,其15亿美元的和解金刷新了美国版权诉讼的赔偿纪录。
此事件不仅是一场数据争夺,也揭示出AI领域的一个核心困境:AI越进步,其训练所需的人类数据就越显短缺。
被破坏的书籍
调查媒体404 Media在今年7月披露的信息显示,诸多AI公司通过数据中介ISBNdb,大肆采购二手书籍,将书脊剪掉、用高速设备扫描,之后彻底销毁。订单数量从千本到百万本不等,书商们的销量在几个月内暴涨了五倍。Anthropic的内部文件揭露,其“巴拿马计划”(Project Panama)仅一年内就花费上千万美元购买了数百万册实体书,拆解并扫描完毕后全部作废处理。
AI公司为何愿意投入重金购买旧书、拆解图书再予以销毁?症结所在是它们亲手制造的数据污染问题。
斯坦福大学2026 AI指数报告指出,自2025年初,互联网新发布的内容中,AI生成内容的比例已达到51.72%。在ChatGPT问世前,这个比例几乎为零。Cloudflare提供的数据进一步展示这一趋势,在其托管网站的网络请求中,约有57.4%源自AI与自动化程序,人类发起的请求仅占42.6%。但需要注意的是,该数据统计的是HTTP请求次数,而不是人类的实际阅读量。一个AI代理可访问成千上万个页面,而人类通常只需几次点击。
当AI模型采用AI生成的内容进行再训练,就容易出现“模型塌缩”(Model Collapse)的现象。2024年7月,刊登在Nature期刊上的一项联合研究由牛津大学、剑桥大学等多家机构联手完成。研究者使用Meta的OPT-125m模型,输入了一段描述14世纪教堂塔楼的维基百科文章。模型的输出从第一代还在讨论建筑细节,到第五代开始偏离至语言翻译,第九代已兴奋地介绍起一些并不存在的兔子种类。从教堂到兔子,仅经过了九次迭代。
递归训练使得模型输出质量的下滑态势(依据Nature 2024封面文章的研究数据)
论文表明,导致塌缩的因素涉及三类误差的叠加效果:统计近似误差(因有限采样导致尾部信息丢失)、函数表达误差(神经网络难以完美模拟分布)、函数近似误差(优化算法内部存在结构偏差)。只要三类误差中存在任何一种,塌缩就无法避免,这是数学上的必然结果。
Epoch AI的估算给出了明确的期限,语言模型将在2026年至2032年之间耗尽公开的人类高质量文本资源。看似是解药的综合数据,但微软Phi-4、谷歌Gemma等模型已掺入人造数据,相关研究揭示,训练数据中哪怕仅有0.01%的虚假内容,都能使模型有害输出增加11.2%,这是一个指数级的关联。
唯有掌握了“模型塌缩”这一逻辑基础,才能理解AI公司为何愿意斥资数千万美元去购买那些“2022年前印刷的纸质书”。ISBNdb在其官方博客中直白地解释了关键点:“2022年前印刷的纸质书,从结构上确保未受到此类污染的干扰。这一特性本身就值得关注。”
互联网新发布内容里AI生成内容的占比变化(资料来源:斯坦福2026 AI指数报告)
更令人担忧的是,作者群体开始采取对抗措施。芝加哥大学研发的Nightshade工具,能在图像中植入对人类视觉无碍但令模型失效的像素级调整。文本领域的同类工具也在逐步开发之中。
自2024年Nightshade工具面世以来,已被大量下载使用。Anthropic与英国AI安全研究所的联合研究表明,只需250份精心设计的恶意文档,就能在数额达数千亿token的语料库中给模型设置后门。这意味着经由网络搜集的数据难以确保纯净,唯有纸质书,在时间线上天然具备免疫性。
然而,现实存在这样的困局:旧书








