• logo

【張瑞雄專欄】人類的書架 AI的礦場

張瑞雄/台北商業大學榮譽講座教授

媒體《404 Media》追蹤了一批被收購的珍稀二手書,在書頁之間藏入定位裝置,最終確認整批書籍抵達的目的地是Amazon位於內華達州拉斯維加斯的一座倉庫。這裡的工作只有一項,割掉書脊,讓頁面快速通過掃描機,然後把原本的實體書丟棄。換言之,書被掃描完了,就消失了。

這不是孤立事件,而是整個AI產業在訓練資料逐漸枯竭之後的可怕行為。

舊書成了AI燃料

為什麼是舊書?道理並不複雜。大型語言模型問世之後,網路上越來越多的文字並非人類書寫,而是由AI生成。若繼續用AI輸出的文字訓練下一代模型,研究者稱之為「模型崩潰」,也就是訓練品質會逐步劣化。於是在202211ChatGPT問世前出版的書籍,成為最純粹、最無污染的人類文字語料,從商業角度看,其稀缺性正在快速攀升。

二手書商因此意外地迎來一波訂單熱潮,英國二手書店Barter Books的創辦人表示,某單筆訂單的金額相當於他平時一週的收入。倫敦北部的書商也有類似感受,他說生意好是好,「但若這些書最終是被銷毀的,那就令人難過了。」

令人難過的事情,確實正在發生。Anthropic的「巴拿馬計畫」在2026年初解封的法庭文件中曝光,那份內部備忘錄的第一行白紙黑字寫著:「巴拿馬計畫是我們摧毀性掃描全世界所有書籍的努力。」備忘錄還特別叮嚀員工,「不要讓外界知道我們在做這件事。」液壓裁書機切下書脊,高速掃描機吞下頁面,剩下的紙張送進回收車。整個過程工業化,整個過程不留痕跡。

在這之前,Anthropic因使用非法盜版電子書訓練模型而捲入集體訴訟,最終以15億美元達成和解,成為美國著作權史上金額最高的賠償案之一。巴拿馬計畫是「合法」的替代方案,聯邦法官裁定,買下實體書之後進行摧毀性掃描,屬於「合理使用」,因為掃描前後各只有一本書,並未構成侵權複製。法律上站得住腳,道德上卻讓許多人如骨鯁喉。

損失的是人類的知識

大量印行的暢銷書被毀,頂多令人惋惜,但古董書和一些十八世紀的孤本,一旦掃進機器、書頁散落,那個版本在物質世界就消失了。數位檔案留著,但那是誰的檔案?是Anthropic的私有訓練資料,不對外開放,不能進圖書館,也不能供學者引用。

這與Google Books當年的數位化計畫性質不同,Google雖然也曾因著作權問題打了多年官司,但其建立的索引至少是公開可搜尋的,讀者看不到全文,卻能確認一本書的存在、知道它在哪裡。AmazonAnthropic的版本是另一回事,書籍的物質形體消滅,數位遺體關進私人伺服器,外人無從接觸。

更令人警惕的是,古老的技術文獻、絕版的地方志、從未數位化的區域性學術著作,正是這波收購的最優先目標。越冷僻、越難在網路上找到,訓練價值越高。這些知識本來沉睡在舊書架的角落,等待識貨的人翻開。如今它們面臨的命運是被機器吞噬,轉化成模型裡某一層神經網路的權重,再也沒有人能指著某一頁紙說:「這裡就是知識的源頭。」

AI正在毀文亡史

AI產業慣於用「合法」來終結討論,掃描自己買的書,法官說合理使用,那就繼續。Twitch讓所有直播主自動加入AI訓練授權,除非主動退出,這是服務條款,是合約,法律上沒有問題。Google1千萬美元從破產的Spirit Airlines買下約1億封內部電子郵件,買的是資產,合法。

問題從來不只是合不合法,圖書館花了幾個世紀建立的觀念是知識應該可及、可查驗、可傳承。大學裡教資訊素養,強調的是追溯來源、確認脈絡。然而當一本書掃進AI的黑箱,它的知識以模型輸出的形式流出,原始出處無從辨識,版本差異無從追蹤,就連「這個說法出自哪本書的哪一頁」這樣基本的學術問責,都已無法成立。

最近流行的一句話就是:「欲滅其國,先亡其史。欲亡其史,先毀其文。」AI正在毀文亡史滅國矣!

※以上言論不代表梅花媒體集團立場※