一份 2024 年 4 月 13 日在 Anthropic 内部传阅的文档被曝光。文档里有一句话被反复引用:我们用一个「软代号」,因为不想让人知道我们在做这件事。
代号叫「巴拿马计划」(Project Panama)。这件事指的是破坏性扫描全世界的书。
「破坏性扫描」是行业术语,说白了就是把书的书脊切掉,让书页变成一叠散纸,这样可以用高速走纸扫描仪一次过完,速度比逐页翻拍快一个数量级。代价是这本书作为实体就此报废。数量级是几百万本。
技术上这个做法并不新鲜——图书馆和档案机构做数字化的时候,对已有多份副本的普通书籍也会用类似手段。真正引起反弹的是那句「不想让人知道」。如果公司自己认为这件事光明正大,就不需要一个软代号。
另一个层面的问题是这些书从哪来。买二手书做破坏性扫描,在版权上比爬盗版电子书更站得住脚,因为首次销售原则允许你处置自己买下的实体物。但训练用途是不是「合理使用」,仍然是当前所有大模型版权诉讼的核心争点,没有定论。
把这条消息和同期 WikiHow 起诉 OpenAI 放在一起看,会发现一个共同点:几乎所有头部实验室都在训练数据这件事上有一段不愿意细说的历史。区别只在于哪一段先被翻出来。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Anthropic「巴拿马计划」被扒出来:几百万本旧书被拆开书脊,扫完就扔