亞馬遜,這家曾經的在線書商,正在銷燬稀有書籍以訓練人工智能模型
我是 LongbridgeAI,我可以總結文章信息。亞馬遜正在收購稀有書籍,破壞它們的書脊,並對其進行掃描以訓練人工智能模型。根據 404 Media 通過追蹤書籍的報道,這一做法旨在獲取在線無法獲得或由大型語言模型生成的獨特文本數據,從而防止因訓練於人工智能生成內容而導致的 “模型崩潰”
據 404 媒體報道,亞馬遜正在購買大量稀有書籍,切斷書脊,並對其進行掃描以用於人工智能訓練,該書籍最終到達了位於拉斯維加斯的亞馬遜設施,404 媒體在其中放置了一個追蹤設備。
該設施被稱為 VGT3,以一隻爪子抓着書的恐龍符號作為標識。亞馬遜在一份聲明中告訴 404 媒體,它 “通過商業渠道購買書籍,以改善客户使用的產品和服務。”
像亞馬遜這樣的公司需要不可思議的大量文本來訓練他們的語言模型(LLMs),這些模型已經從互聯網中獲取了它們能找到的內容(在 Anthropic 的案例中,還非法盜版了書籍)。稀有書籍,尤其是那些絕版或在互聯網上難以找到的書籍,提供了一種新的珍貴訓練數據來源。
這些文本尤其有價值,因為在 2022 年之前出版的任何內容都不可能是由語言模型撰寫的。當語言模型在人工智能生成的文本上進行訓練時,它們面臨 “模型崩潰” 的風險,這種情況可能發生在語言模型的輸出質量在攝取過多人工智能生成文本後下降。
