📝📝:每三篇新的網頁就有一篇出自機器之手,AI 寫的內容比人類還要更加正面、更少衝突

鋼哥
·
·
IPFS
·
我們每天閱讀、轉發、引用的網路文字,已有相當大比例不再單純出自人類之手。

「網路已經死了,你現在看到的內容多半是 AI 在自說自話。」

大約 2016~2017 年間,這種說法開始在網路論壇間流傳,被稱為死亡網路理論(Dead Internet Theory),過去大多被當成一種誇張的都市傳說。而今,半數美國成年人已經習慣與 AI 聊天機器人對話,其中 24% 每天都在使用時,這個聽起來陰謀論式的說法,是否正在悄悄成真?

皮尤研究中心(Pew Research Center),以及由帝國理工學院(Imperial College London)、網際網路檔案館(Internet Archive)與史丹佛大學(Stanford University)組成的跨校團隊,在過去幾個月內分別用不同的資料庫與方法,交出了目前最嚴謹的量化答案。


皮尤的網路快照

皮尤研究中心從共同爬取網路檔案庫(Common Crawl)中抽取了近五年、約 49 萬則英文網頁文本,時間橫跨 2021 年到 2026 年 7 月,再以一套名為 Pangram 的 AI 偵測工具(開源版本 Open Pangram)逐篇檢測文章語言模式中的「AI 痕跡」。

結果顯示,2026 年 7 月抽樣的一萬則網頁中,將近 10% 呈現明顯的 AI 寫作特徵。乍看比例不高,但網路上仍堆積大量 ChatGPT 問世之前的舊內容;若只計算 2022 年 11 月 ChatGPT 上線之後才發布的網頁,比例便躍升到超過三分之一(35%)。

▲ ChatGPT 上線之後才發布的網頁,比例已躍升到超過三分之一(35%)。來源:皮尤研究中心

也就是說,近幾年新誕生的網路文字,每三篇就有一篇以上帶有顯著的 AI 書寫痕跡。而且,AI 內容的分布也極不均勻。

ChatGPT 剛推出時,.com、.org、.edu、.gov 等主要頂級網域的 AI 痕跡比例相近;但到了 2026 年,.com 網域(約 10%)已約是 .org 網域(4.6%)的兩倍,更是 .edu 與 .gov 網域(各約 1%)的十倍。反映了不同網路空間的把關機制差異:學術與政府網站有較嚴謹的審稿流程,商業網站則更仰賴內容產出的速度與規模。

皮尤團隊也整理出幾項具體的語言「指紋」:

  • 相較於 2023 年,em 破折號(em dash, — )的使用頻率翻倍

  • 牛津逗號(Oxford comma)的使用增加 63%

  • delve(深入探討)、interplay(交互作用)、testament(見證)等 AI 偏好詞彙的出現率翻倍以上

  • 「並非只是 X,而是 Y」這種「負向排比」句式雖然整體仍屬罕見,成長幅度卻接近三倍。

當然,單一篇文章出現破折號不代表就是 AI 寫的 — — (我故意加的)但把數十萬篇文章放在一起統計,這些差異就足以形成可辨識的群體特徵。


跨校團隊的交叉驗證

在皮尤報告發布前約四個月,Jonas Dolezal(隸屬帝國理工學院)、Sawood Alam 與 Mark Graham(隸屬網際網路檔案館)、Maty Bohacek(隸屬史丹佛大學)組成的團隊,發表了一篇路徑完全不同的論文《The Impact of AI-Generated Text on the Internet》

他們透過網際網路檔案館的「時光回溯機」(Wayback Machine)建立橫跨 2022 年 8 月至 2025 年 5 月、共 33 個月的代表性網頁樣本,並在測試 Binoculars、Desklib、DivEye、Pangram v3 四款偵測工具後,選擇商用版 Pangram v3。

Pangram v3 在文字長度、HTML 嵌入格式、模型版本、模型家族(GPT-4o、Claude、Gemini)與多語言五個面向上,都展現出最一致的判準表現;相形之下,Binoculars 對 Claude 生成文字的辨識能力明顯較弱,DivEye 則幾乎無法在英語以外的語言中做出有效區分。

這組團隊的結論是:

截至 2025 年年中,每月新發布網站中被判定為「AI 生成」(fully AI-generated) 或「AI 輔助」(AI-assisted) 的比例已高達 35%,而這個數字在 ChatGPT 上線前趨近於零。

儘管資料庫、判準門檻與時間範圍都與皮尤報告不同,兩者對「AI 滲透網路的速度與規模」給出的量級卻高度吻合。這種跨方法、跨機構的收斂結果,比任何單一報告都更具說服力。

▲ 截至 2025 年年中,每月新發布網站中被判定為「AI 生成」或「AI 輔助」的比例已高達 35%。來源:該研究


六個假設,兩種真相

這篇論文同時檢驗了六項關於「AI 內容如何改變網路生態」的流行假設,並比對「大眾相信什麼」與「數據實際顯示什麼」之間的落差。

研究團隊先以 903 份問卷回覆(來自 853 位透過 Prolific 招募、具代表性的美國成人)測量民眾對六項假設的認同程度,再從網際網路檔案館樣本計算對應的量化指標,檢驗兩者的皮爾森相關係數(Pearson correlation coefficient)。

=================

〔名詞解釋〕ρ 是什麼?

皮爾森相關係數裡的 ρ(唸作 rho)衡量兩個變數是否同步變動,數值介於 -1 到 +1。只要越接近 +1 代表兩者同向變動越強(成正比),越接近 -1 代表反向變動越強(成反比),接近 0 則代表幾乎無關。旁邊的 p 值則是判斷這個相關性是否「統計顯著」的門檻,慣例上 p < 0.05 才視為可信。

|ρ| 在 0.1 以下幾乎可忽略、0.1–0.3 算弱、0.3–0.5 算中等、0.5–0.7 算強、0.7 以上算很強。但這只是經驗法則,不同領域的門檻認定會有差異。

===============

六項假設中只有兩項獲得統計顯著支持。

語意收縮假說(Semantic Contraction Hypothesis)成立。AI 內容增加時,網路文本間的語意相似度顯著上升(ρ = 0.47,p = 0.004),AI 內容彼此的語意相似度比人類寫作高出 33%。

正向情緒偏移假說(Positivity Shift Hypothesis)也成立。AI 內容的正面情緒分數顯著較高(ρ = 0.56,p = 0.0003),比人類寫作高出 107%,顯示 AI 文本確實傾向更四平八穩、更少衝突性表達。

▲ 六項假設中只有兩項獲得統計顯著支持。來源:該研究

但另外四項全都沒有通過統計顯著性檢定。

  1. 真相衰退假說(Truth Decay Hypothesis)
    ——AI 增加導致事實錯誤更常見。

  2. 知識孤島假說(Epistemic Island Hypothesis)
     — — AI 文章更少附外部連結佐證。

  3. 熵稀釋假說(Entropy Dilution Hypothesis)
     — — AI 內容篇幅變長但語意密度降低。

  4. 風格同質化假說(Stylistic Monoculture Hypothesis)
     — — 個人寫作風格趨向單一聲音。

最諷刺的是風格同質化假說,是六項中民眾認同度最高的(83.0% 傾向同意),量化數據卻找不到顯著相關(ρ = 0.24,p = 0.17);真相衰退假說也有 75.1% 民眾相信,但研究者動用 AI 提取聲稱、再由人工事實查核員逐一驗證後,同樣沒有找到顯著關聯(ρ = -0.19,p = 0.27)。


民眾為何相信「還沒被證實」的事

較少使用 AI 工具的受訪者,比頻繁使用者更傾向相信 AI 內容正在造成傷害(88.3% 對 76.2%,相差 12.1 個百分點);對 AI 整體持負面觀感者,也比抱持正面或中立態度者更相信這些負面影響是真實的(91.3% 對 71.1%,相差 20.2 個百分點)。

研究者將這個落差詮釋為,眼下網路真正面臨的威脅或許不在「事實層次」,「知識論層次」的信任危機更容易取信於民。

當 AI 生成文字愈來愈難與人類寫作區辨,使用者可能不再逐篇檢驗真偽,反而選擇性地對整個網路的可信度打折扣,研究者稱之為「現實冷感」reality apathy,甚至讓有心人士得以用「反正網路都是 AI 造假」來卸責,也就是「說謊者紅利」(liar’s dividend):

真實的資訊也可能因這種普遍懷疑而被輕易否認。


收縮的語意空間,過度樂觀的網路

把兩項獲驗證的假設放在一起看,會浮現一幅更完整的圖像:

AI 沒有讓網路充斥錯誤資訊,卻正在悄悄壓縮語意光譜,同時又把整體語氣調得更加正向。

論文作者的解釋是,語言模型在生成時傾向輸出更接近訓練資料分布平均值的內容,這使網路上可被公開討論、視為合理的意見範圍逐漸縮小;同時語言模型普遍存在的諂媚傾向與過度樂觀特質,讓大量網路文字染上一種「被消毒過的」樂觀色調。

▲ AI 沒有讓網路充斥錯誤資訊,卻正在悄悄壓縮語意光譜,同時又把整體語氣調得更加正向。Photo by Berke Citak on Unsplash

這件事之所以重要,是因為多元民主的公共討論仰賴摩擦與異議。論文引用政治學者 Chantal Mouffe 的「競爭性多元主義」(Agonistic Pluralism)概念指出,一個過度同質化、過度正向的言論環境,可能在不使用任何明顯造假手段的情況下,悄悄邊緣化真實異議。

研究者也強調,這股同質化的驅力主要來自規模化生產內容的成本優勢,而非集中的操縱意圖;不過,這反而讓問題更難處理。平台原本就有應對仇恨言論或不實資訊的機制,卻沒有工具能衡量或治理「語意多樣性」與「知識論品質」。


偵測技術的極限

兩份研究都誠實指出偵測工具的侷限:

短於 50 字的文本準確率普遍下降;不同工具在跨語言、跨模型、文字是否嵌入 HTML 時表現差異極大;以 Pangram v3 為例,面對較舊的完成式模型(如 davinci-002)時完全偵測不到。

任何單一篇文章被貼上「AI 生成」標籤都可能誤判,唯有在大規模統計層次,這些訊號才具解釋力。論文也提出一個長期隱憂:

當前網路上約 1/3 的新內容已是 AI 生成或輔助,未來大型語言模型若持續以「從網路爬取的資料」進行預訓練,勢必大量攝入 AI 自己生成的內容。

這正是「模型崩潰」(Model Collapse)理論從假設性風險轉為實證疑慮的關鍵時刻。模型持續在自我生成資料上遞迴訓練,長期可能導致輸出品質與多樣性衰退,儘管對齊與後訓練階段因主要仰賴新產出或環境互動資料,受衝擊可能較小。

▲ 未來大型語言模型若持續以「從網路爬取的資料」進行預訓練,勢必大量攝入 AI 自己生成的內容。Photo by Brett Wharton on Unsplash

至於治理方向,研究者對現行以「事後偵測」與「浮水印」(watermarking)為核心的政策路徑(如歐盟人工智慧法案 EU AI Act 的相關規範)持保留態度,認為這類技術容易被規避、可靠性也會隨時間變化。

研究建議未來應轉向「加密驗證的人類創作來源」,例如 C2PA 內容來源標準(C2PA, Content Credentials),並重新設計推薦演算法,讓語意多樣性與經驗證的人類原創性,得到與流量、參與度同等重要的權重。

兩份研究都提醒讀者,AI 生成文字並非只有負面意涵。LLM 可能同時降低非母語使用者、低識字率族群參與公共討論的門檻,協助複雜文件的摘要與資訊親近化,甚至能將全球知識在地化到資源稀缺語言的社群中。

AI 該不該禁止用於書寫並不是關注的重點,只要有心,人人都可以找到規避的作弊手段;真正該看見的是,我們是否準備好辨識、理解並主動治理這股正在重塑網路語意生態的力量。

從共同爬取網路檔案庫到網際網路檔案館的時光回溯機,兩組研究者用截然不同的路徑,指向同一個正在發生、卻少有人真正意識到規模的轉型:

我們每天閱讀、轉發、引用的網路文字,已有相當大比例不再單純出自人類之手。

這不必然是一場災難,但絕對值得每個網路使用者停下來,重新校準自己的閱讀習慣與信任機制。


CC BY-NC-ND 4.0 授权

喜欢我的作品吗?别忘了给予支持与赞赏,让我知道在创作的路上有你陪伴,一起延续这份热忱!

鋼哥從物理到電機工程再轉到資訊傳播,最後落腳在社會學。衣櫃拿來當書櫃擺的人。我常在媒介生態學、行為經濟學、社會學、心理學、哲學游移;期盼有天無產階級可以推倒資本主義的高牆的兼職家教。
  • 来自作者
  • 相关推荐

📝📝:十二個座標:中國用戶的一場「攻台兵推」,如何在聊天視窗裡完成

📝📝:王偉忠 vs 沈伯洋,訪談出了誰的圈?真正跨出同溫層的,恐怕就只有王偉忠

📝📝:AI 寫作,正在悄悄改寫我們的立場與聲音|中文世界的語言,正被誰改寫?