AI行业涌现出一个新隐喻——“Slurp juice”(吸吮果汁)。这一曾形容NFT荒谬机制的词汇,如今精准刻画了大型实验室疯狂追逐新鲜素材以喂养模型的现状:贪婪吸吮、无情消耗,一旦源头枯竭便迅速转向。

随着新模型每周密集发布,底层燃料——高质量文本、代码、图像和对话——日益稀缺。曾推动早期突破的开放网络,已无法提供同等回报。这揭示了前沿AI多年来的激进数据策略:大规模爬取、绕过付费墙、未经许可利用新闻、书籍及社交媒体数据进行训练。这种策略虽带来功能飞跃,但也引发诉讼、反爬虫措施及内部伦理警告。

在《纽约时报》起诉OpenAI和微软的版权案中,解封文件描绘了严峻图景。微软应用科学总监布伦特·赫希(Brent Hecht)称此举为“史无前例的大规模盗窃”,甚至可能是“人类历史上最大的劳动盗窃”,使“合理使用”概念沦为笑柄。OpenAI高管尼克·特利(Nick Turley)则警告出版商面临“生存威胁”。文件显示,AI产品推出后,部分新闻机构点击率暴跌51%至94%。

数据攫取规模令人震惊。仅Common Crawl一个数据集就包含来自nytimes.com的200多万份文档;中间训练集收录超9.1万份《纽约时报》等媒体作品副本。据报道,员工曾设计方法绕过付费墙,“芒果项目”和“出租车项目”更在两家公司间输送新闻内容用于训练评估。

数据干旱显现,各方加速反击

数据短缺已成现实。麻省理工学院主导、数据溯源倡议组织发布的最新研究显示,在C4、RefinedWeb和Dolma三大主要训练数据集中,5%的数据因robots.txt或服务条款限制访问,而在最高质量来源中这一比例达25%。C4数据集中近45%的数据受服务条款限制。主要作者谢恩·朗普雷(Shayne Longpre)指出:“同意率正在快速下降。”

过去一年,限制措施加速推进。Reddit已开始授权数据,谷歌每年支付约6000万美元,OpenAI据报每年支付约7000万美元。Meta首席执行官马克·扎克伯格强调,Facebook和Instagram帖子在体量及非正式多语言表达上远超Common Crawl。

新闻机构纷纷达成直接交易。阿克塞尔·施普林格集团、《金融时报》及学术出版商威利(Wiley)签署了数百万美元许可协议。Shutterstock 2024年数据许可收入达1.38亿美元。Troveo数据显示,整体AI训练数据集市场规模今年接近40亿美元,预计2030年代初将翻数倍。

新成立的数据集提供商联盟(Dataset Providers Alliance)呼吁建立“选择加入”系统,要求创作者明确同意方可用于AI训练,直接挑战“公开可用”理由。维基媒体基金会也驳斥OpenAI,指出免费内容被纳入训练隐含高昂运营成本,搭便车行为终将付出代价。

矛盾核心:公开推崇开放,私下激进爬取

AI公司并未停止行动,而是进行转型。合成数据填补部分空白,但在新颖性和边缘案例上表现不佳;倒闭企业的内部记录因捕捉真实工作过程而变得珍贵;机器人技术和物理AI需要未公开数据;社交平台的实时用户行为信号优于静态网络爬取。

然而,“饥饿感”依然存在。近期报道显示,尽管有公开声明,多家实验室的AI代理仍绕过robots.txt信号。澳大利亚广播公司向议会表示,OpenAI和Anthropic规避了退出机制,并在当地游说修改版权法以简化内容训练。谷歌则警告,若要求事先授权,AI开发将变得不可能。

行业处于矛盾中心:实验室公开推崇开放创新,私下却承认道德和商业风险;一边高价许可数据,一边在可行处继续激进爬取;一边内部警告摧毁创意产业,一边依赖其产出。

随着模型不断变大,GPT变体层出不穷,Meta、Anthropic、Google和xAi投入巨资构建更大系统。每一次进步消耗更多数据,需求每年翻倍,而高质量公共内容增长缓慢。“吸吮果汁”的时代不会永远持续。当果汁耗尽,赢家将是那些能规模化创造新高质量材料,或构建从更少数据中高效学习系统的企业。将整个互联网视为无防护自助餐的日子正在结束,同意、补偿和谨慎筛选正从障碍转变为竞争优势。