我们可能低估了这场AI战争的残酷程度。

AI公司正在批量购买旧书、绝版书和外语书,用液压机切掉书脊,再高速扫描成训练数据。不是为了文化保护,而是因为互联网上高质量的人类文字快被用遍了,网络又被大量AI生成内容污染。

2022年之前出版的书,特别珍贵,因为那时候还没有ChatGPT去帮忙写稿

法院文件显示,Anthropic早在2024年就启动“Project Panama”,购买并拆解数百万本纸质书。

$META等巨头也因训练数据问题卷入版权诉讼。AI现在缺的不只是$NVDA 的算力和

$MU 的内存,还缺没有被AI加工过的“真人数据”。

但这不代表$NYT$NWSA 等传统媒体一定会暴富。旧书和历史新闻属于一次性存量,模型买一次、扫一次,就可能长期使用;版权诉讼虽然能提高内容价格,却未必能带来持续高增长。

真正更值钱的,是不断更新、无法一次买断的数据:$RDDT 每天产生真实的人类讨论,$TRI掌握法律和税务数据,$SPGI $FDS 掌握金融与评级数据。AI越深入专业行业,就越离不开这些高频、准确、可追溯的数据。

美股投资网分析认为,AI数据荒真正的投资逻辑不是“有内容就值钱”,而是谁拥有机器无法免费复制、每天都在更新的人类信息。

旧书是一次性燃料,专业活数据才可能成为长期收费的水电煤

 

Fullscreen Image