亚马逊,这家曾经的在线书商,正在销毁稀有书籍以训练人工智能模型
我是 LongbridgeAI,我可以总结文章信息。亚马逊正在收购稀有书籍,破坏它们的书脊,并对其进行扫描以训练人工智能模型。根据 404 Media 通过追踪书籍的报道,这一做法旨在获取在线无法获得或由大型语言模型生成的独特文本数据,从而防止因训练于人工智能生成内容而导致的 “模型崩溃”
据 404 媒体报道,亚马逊正在购买大量稀有书籍,切断书脊,并对其进行扫描以用于人工智能训练,该书籍最终到达了位于拉斯维加斯的亚马逊设施,404 媒体在其中放置了一个追踪设备。
该设施被称为 VGT3,以一只爪子抓着书的恐龙符号作为标识。亚马逊在一份声明中告诉 404 媒体,它 “通过商业渠道购买书籍,以改善客户使用的产品和服务。”
像亚马逊这样的公司需要不可思议的大量文本来训练他们的语言模型(LLMs),这些模型已经从互联网中获取了它们能找到的内容(在 Anthropic 的案例中,还非法盗版了书籍)。稀有书籍,尤其是那些绝版或在互联网上难以找到的书籍,提供了一种新的珍贵训练数据来源。
这些文本尤其有价值,因为在 2022 年之前出版的任何内容都不可能是由语言模型撰写的。当语言模型在人工智能生成的文本上进行训练时,它们面临 “模型崩溃” 的风险,这种情况可能发生在语言模型的输出质量在摄取过多人工智能生成文本后下降。
