4 成銷售被 AI 書拿走:一份 1.4 萬本小說研究,揭開市場「稀釋效應」

生成式 AI 寫出來的書,常被貼上「slop」的標籤,也就是低品質、公式化的垃圾內容,一般認為讀者看一眼就會略過,在商業上根本無足輕重。過去探討 AI 與創意工作的研究,也大多繞著同一個問題打轉,就是 AI 產出的東西,到底好不好到能取代人類。

但一份分析 Amazon 逾 1.4 萬本自出版類型小說的研究,給出不一樣的觀察角度:AI 撼動這個市場,靠的根本不是品質。這些含有 AI 文字的作品,單本銷量普遍不好,卻已經改變了整個市場的收入結構。

怎麼看出一本書有多少 AI?

要回答這個問題,需要先算出每本書到底含有多少 AI 文字。這份由 Stony Brook 大學、哥倫比亞大學法學院與密西根大學等團隊合作的研究,蒐集了 14,419 本 2023 到 2026 年間上架的自出版(self-published sales)類型小說電子書,銷售一路追蹤到 2026 年 6 月,並比對一份涵蓋 Amazon 電子書市場約 95% 以上每日銷量的專屬銷售面板。

該團隊用 AI 偵測工具 Pangram 逐段分析每本書,再依 AI 文字占比分成完全無 AI 文字、輕度(25% 以下)與大量(超過 25%)三組。方法上最大的突破,是它看的是整本書的全文,而不是過去研究常用的千字試閱片段。正因為看的是全文,研究者才問得出一個過去沒辦法回答的問題,就是這些 AI 書,到底對它們身邊的其他書造成了什麼影響。

當書架擴張的速度,遠超市場能吸收的速度

研究最關鍵的發現,是一種被作者稱為「稀釋」(dilution)的現象,指的是市場被大量可替代的作品灌爆之後,每一本書能分到的收入和關注都被攤薄。

數字揭開一個嚴重失衡的市場:2023 到 2026 年間,每季有銷售紀錄的書種數量成長了 19.2 倍,同期整體營收卻只增加 8.9 倍。上架和賣出的書,遠遠多過市場消化得了的量,平均每本書能分到的收入自然就被攤薄。

從占比也看得出這種落差。含大量 AI 文字的書占了全部書目約 20%,卻只拿下 12.1% 的銷售和 11.3% 的營收;完全沒有 AI 文字的作品占書目約 62.9%,銷售和營收占比則分別高達 71.7% 與 72.5%。單看平均,AI 書確實賣得比較差。但研究把時間軸拉開來看就會發現,含 AI 文字作品(輕度加大量)的觀察銷售占比一路往上爬,到 2026 年第二季已經逼近 40%。

這些 AI 文字作品也沒有乖乖待在市場底層,甚至開始攻上頂端。研究把每個類型每週賣得最好的前 25 本抓出來看,發現新擠進這份榜單的書當中,含大量 AI 文字者的比例,從初期的近乎零一路升到 31%。也就是說,AI 書不只灌爆了市場底部,還開始搶佔那些最稀缺、最難擠進去的暢銷位置。

各 AI 文本比例區間之圖書銷售份額。圖片來源:a16z。

真正的警訊,是稀釋已經蔓延到真人作品身上。如果只是一堆賣不動的 AI 爛書灌爆書目、把平均值拉低,那還稱不上什麼市場問題。但研究比較不同上架年份的作品後發現,就連完全沒有 AI 文字的書,越晚上架的一批,每本營收也跟著下滑。

研究者打了一個很貼切的比方,這不像班上來了幾個成績差的學生,只拉低全班平均、卻不影響好學生的分數,真正發生的是,連好學生的成績也一起被拖了下來。

這種下滑在 AI 滲透較深、Kindle Unlimited 訂閱占比較高的類型最明顯。因為訂閱制讓讀者從同一個共享的閱讀池取用內容,每一本新湧入的 AI 書,都在搶同一批有限的借閱。

有人或許會說,真人書賺得變少,會不會只是整個出版業景氣不好?但數字剛好可以反駁這一點。在 AI 進場最晚、滲透最淺的奇幻/超自然/恐怖類,真人作品的每本營收不但沒跌,越晚上架的一批反而還上升了 35%。如果是大環境的問題,這一類不會獨強;它之所以撐住,正是因為 AI 還沒真正淹進來。

品質不是門檻,讀者甚至分不出來

值得留意的是,《The Guardian》報導的另一項實驗,從另一個角度帶出一個更麻煩的問題。這項刊在期刊《Judgment and Decision Making》的研究,讓 1,682 名成人各讀一篇短篇小說,六篇裡三篇由人撰寫、三篇由 ChatGPT 生成,結果讀到 AI 故事的人,給的吸引力和品質評分反而更高。

研究另外找了 905 人去分辨兩篇同主題的作品哪一篇出自 AI,兩次實驗分別只有大約 40% 和 52% 猜對,幾乎跟亂猜差不多。帶領這項研究的維拉諾瓦大學學者 Deena Skolnick Weisberg 說,AI 已經寫得出被認為不輸人類、甚至更好的短篇,大家對 AI 的看法也該跟著調整。

那麼,那些賣得好的 AI 書,成功的關鍵又在哪?前面那份 1.4 萬本書的研究,進一步分析了暢銷書的文字特徵,發現賣得好的 AI 書,更大量取用了既有書籍裡罕見又獨特的語句。在銷售前 50 名的作品當中,含大量 AI 文字者取用這類罕見語句的比例平均達 45.0%,高過無 AI 文字作品的 37.7%,而且取用得越多,營收往往越高。也就是說,暢銷 AI 書賣得好,跟它重組既有作品的語言關係密切。

為什麼「稀釋」值得關注?它正落在 AI 版權訴訟的核心

1.4 萬本書的研究團隊指出,市場稀釋之所以重要,是因為它直接踩到 AI 版權訴訟裡最關鍵的「市場效果」爭點。這套理論已經獲得美國版權局採納,也在 Kadrey 訴 Meta 一案裡,被 Chhabria 法官視為可能左右合理使用(fair use)判決的關鍵,只是那個案子的原告拿不出證據。而這份市場層級的分析,補上的正是過去一直缺的那份實證。

該研究也釐清了法律責任到底該怎麼算。在這類訴訟裡,可能的侵權責任,來自 AI 業者為了訓練模型,在上游大規模複製受版權保護的作品;至於 AI 產出的作品拿去和人類作品競爭這件事本身,只要沒有複製行為,並不算侵權。這樣的爭議早就不是假設。根據《The Financial Times》報導,Anthropic 近期已經同意付出 15 億美元,跟作家和出版商和解,在此之前它沒有取得授權、也沒有付費,就拿了逾 48 萬本已出版著作去訓練自家的大型語言模型。

出版業的回應:「由真人撰寫」成了新的價值

面對這股灌書潮,出版業另一頭的回應,是把「由真人撰寫」重新捧成一種看得見的價值。根據《The Financial Times》報導,英美的作家組織已經推出認證標章,作者可以為符合資格的書掛上「Human Authored」標示,代表書裡只有拼字、文法檢查這類極輕微的 AI 介入。多家出版社則在合約裡加進 AI 條款,要求作者揭露 AI 的使用情形,或是保證作品出自本人原創。

當然,前述研究也有它的限制。所有結論都建立在「Pangram 偵測結果等同於 AI 撰寫」這個前提上,而 AI 偵測本身,到現在都還是個準確度很有爭議的領域;研究者也強調,這些比較屬於關聯性、而非因果,數字也只反映單一平台的狀況。

但回到市場本身,這份研究點出的核心始終是數量的力量。AI 書就算單本賣得有限,光是龐大的供給量,就足以攤薄整體收入、擠壓真人作品,而這一切都跟內容品質有沒有勝過人類無關。標章和揭露機制會出現,就是想在這樣一個市場裡,給讀者留一個判斷的依據,讓大家看得出來,眼前這本書,到底出自人,還是機器。

【推薦閱讀】

Cloudflare Wallets 讓 AI Agent 自主付款:為何網路基礎設施商也開始做支付?

【AI 原生新創極速生長】產品全面圍繞 AI 開發,過半新創人均產值衝破 40 萬美元

《時代雜誌》開賣「AI 專屬廣告」,品牌如何影響 ChatGPT 推薦?

*本文開放合作夥伴轉載,資料來源:a16zarXiv《Financial Times》《The Guardian》,首圖來源:AI 工具生成