一顆AirTag追蹤器,揭開亞馬遜「毀書基地」:珍本藏書淪為AI數據飼料

一句話總結:為了避免AI「模型崩潰」,亞馬遜等科技巨頭正在內華達州的秘密倉庫裡,將珍稀實體書拆解、掃描、銷毀,把人類最後的「未污染」智慧結晶當成訓練數據的燃料。

核心要點

  1. AirTag跨州追蹤破案:外媒404 Media將追蹤器藏在1,000本珍稀藏書中,一路從加州追到內華達州亞馬遜倉庫「LAS8」,再定位到內部管制區「VGT3」——揭露了一條隱密的毀書流水線。
  2. 殘酷的「拆書取字」SOP:在VGT3作業區內,書籍先被切斷書脊解體,再送入工業級高速掃描儀數位化。這些文字不會變成電子書供人閱讀,而是直接淪為AI預訓練模型的「數據飼料」,物理紙本隨後直接廢棄銷毀。
  3. 為什麼要這麼極端?AI真的缺糧了:當網路上充斥AI生成的合成內容,AI用AI的資料訓練會引發「模型崩潰」——輸出的內容越來越同質化、邏輯崩壞,連「幻覺」都會被放大。古老實體書籍成了少數「未被AI污染過的黃金礦脈」。
  4. 法律上站得住腳,但文化上代價巨大:目前美國司法判例傾向將此操作視為「合理使用」,因為企業並未將掃描內容公開發行牟利。但文史學者發出沉痛警告:部分絕版書與地方文獻,可能在這場軍備競賽中永遠從物理世界消失。
  5. 亞馬遜不是唯一,而是產業縮影:包括AI獨角獸Anthropic在內的多家商業AI機構,早已加入搶購實體書進行內部訓練的行列。這不是單一企業的決策,而是整個AI產業在資料荒焦慮下的集體選擇。

說真的,這則新聞讓我有種在看諜報片的錯覺。一枚蘋果AirTag,竟然成了揭開科技巨頭「毀書」內幕的關鍵證物。但回過神來,這背後藏著的是一個比科幻電影更荒謬的現實:人類為了教會AI「更像人類」,正在親手銷毀人類文明的實體見證。

404 Media的調查團隊這次玩得很大。他們與珍稀書籍賣家合作,在一筆上千本藏書的訂單中,把AirTag塞進其中一本書的夾層裡。這批文獻從加州出發,一路經過密爾瓦基、科羅拉多州的大章克申,最後定位在內華達州拉斯維加斯東北部的亞馬遜倉庫——代號「LAS8」。更精確地說,是LAS8內部一個名為「VGT3」的管制區域。

公開資料顯示,LAS8主要負責亞馬遜的「按需印刷」服務。但在VGT3裡,上演的卻是完全相反的戲碼:切斷書脊、拆解成散頁、送入工業級高速掃描儀,所有文字在極短時間內被轉化為純文字數據。重點來了,這些數位化後的內容不會上架、不會公開、不會做成PDF或電子書——它們的命運,是直接灌進大語言模型的底層數據集裡,成為訓練演算法的「養分」。榨乾之後,剩下的紙屑和封皮,就只是垃圾。

你可能會問:為什麼要做到這種程度?難道不能直接拿市面上的電子書來訓練嗎?

問題比你想像的更棘手。當前AI產業面臨嚴重的「資料荒」。隨著網路上充斥大量AI生成的內容,開發商發現一個驚人的陷阱——如果用其他AI產出的資料來訓練自己的AI,會引發所謂的「模型崩潰」效應。白話文來說,就是AI會變得越來越笨、越來越沒有創造力,輸出的內容全部長得差不多,連錯誤資訊都會在反覆訓練中被強化為「事實」。

要突破這個瓶頸,AI需要的是「真實、獨特、從未被AI污染過的人類原創內容」。那些年代久遠、還沒被數位化的實體書籍,剛好符合這個條件。它們就像埋在圖書館深處的未開發油田,成為科技巨頭眼中最頂級的訓練材料。珍稀藏書的價值,從「文化資產」被重新定義為「高純度數據礦石」。

從法律層面來看,目前美國法院的判例傾向將這種操作認定為「合理使用」的範疇——只要企業沒有把數位化的內容重新出版或轉售,只作為內部訓練參數使用,基本上合法。但法律上的合法,不代表文化上的合理。當一本書在物理世界裡被徹底銷毀,只留下被AI吸收過的「殘影」,我們失去的到底是什麼?

編輯觀點:這則新聞最讓我在意的,不是亞馬遜做了什麼,而是整個AI產業正在集體默許一種「文明消耗戰」。當我們把珍稀書籍視為「數據飼料」,其實是在用一種極度功利的尺規重新衡量知識的價值。我不反對AI訓練,但反對這種「拆完就丟」的一次性消耗。如果科技巨頭真的需要這些內容,為什麼不能先完成數位典藏、開放學術使用,再拿去餵模型?問題在於——沒有人願意為「保存」買單,但所有人都急著為「訓練」付費。這不是技術問題,是價值選擇的問題。

話說回來,亞馬遜絕非特例。包括Anthropic在內的AI獨角獸,也都已經加入搶購實體書籍的行列。這是一場沒有退路的軍備競賽,但代價卻由人類的文化遺產來承擔。文史學者的擔憂並非杞人憂天——部分絕版書與地方文獻的實體存量本來就極為稀少,如果繼續這樣一本一本拆下去,它們將徹底從地球上消失。到時候,我們只能在AI的資料庫裡「查詢」這些書的內容,卻再也無法親手翻閱那泛黃的紙頁。

我們該用什麼態度看待這件事?

與其恐慌,不如正視一個現實:AI的資料荒不會消失,只會更嚴重。但我們有機會在「訓練需求」與「文化保存」之間畫出一條底線。下次當你聽到又有哪家科技巨頭在大量收購舊書時,別只當成商業新聞看——那背後可能又有一批珍本,正在某個你從未聽過的倉庫代號裡,被切成碎片、餵給機器。

本文改寫整理自公開新聞來源,原始報導由T客邦發布。

常見問題 FAQ

為什麼AI公司不直接使用已數位化的電子書來訓練模型?

因為目前網路上流通的數位內容已大量混雜AI生成的合成資料,AI重複使用這些「被污染」的內容訓練會導致模型崩潰,輸出品質下降。實體書籍因尚未被數位化,被視為少數「純淨」的人類原創來源。

亞馬遜這樣做是否違法?

依目前美國司法判例,此類操作傾向被認定在「合理使用」範圍內,因為企業未將掃描內容公開發行或轉售,僅作為內部訓練參數使用,因此並未違法。

那些被拆解的書真的都很珍貴嗎?

調查中追蹤的1,000本書屬於珍稀藏書,但並非全都是價值連城的古籍。真正的問題在於,部分絕版書與地方文獻的實體存量極少,若持續被銷毀,將面臨在物理世界中徹底絕跡的風險。

除了亞馬遜,還有哪些公司這麼做?

根據報導,包括知名AI獨角獸Anthropic在內的多家商業AI研發機構,也已加入搶購實體書籍並進行內部訓練的行列,這是產業普遍現象而非單一案例。

一般民眾可以做些什麼來保護這些書籍?

關注並支持在地獨立書店、二手書店與圖書館的保存工作,同時呼籲立法者與科技公司建立「數位典藏後再訓練」的規範,確保書籍內容在被使用後仍能留存於公共領域。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。