
記者張杰倫報導
歷時近兩年的糾纏,生成式AI領域迄今金額最高的一宗版權訴訟,終於塵埃落定。美國法院正式批准了Anthropic高達15億美元的著作權和解案,賠償範圍覆蓋約50萬本書籍,平均每本賠償3000美元。這不僅是數字上的震撼,更關鍵的是,法官在裁定中划下了一條所有AI公司都不得不正視的清晰界線:訓練AI本身可以是合理使用,但用來訓練的數據是怎麼來的,決定了你是站在合法一側,還是付出天價代價。
這場風暴的起點並不複雜。Anthropic早期為了訓練Claude模型,從LibGen等盜版書庫抓取了大量受版權保護的文本。原告方直指其侵犯著作權,而Anthropic的辯護策略之一便是主張“訓練即合理使用”。令人玩味的是,法官最終在一定程度上接納了這一邏輯——判決中最精彩的一筆,正是認定將書籍用於訓練AI模型本身,屬於合理使用範疇。這無疑讓不少AI公司暗自松了口氣,因為它為機器學習所需的海量文本輸入留下了一條呼吸通道。
然而,真正的殺招藏在“獲取手段”上。Anthropic的敗訴關鍵,並非把書“餵”給模型這個動作,而是它當初“拿書”的方式。法官清晰地切割了“訓練”與“獲取”兩個行為:通過非法渠道從盜版書庫批量下載內容,這一行為本身即構成對版權的直接侵犯,不能因其最終目的是服務於AI訓練就被漂白。換句話說,如果你走進書店花錢買了一摞書回家研讀做筆記,那是合理使用;但如果你潛入倉庫偷走同一批書再回家研讀,即便研讀過程再正當,從推門進去那一刻你就已經違法了。
這一區分,等於為整個狂飆突進的AI產業當場寫下了遊戲規則。法律給出的信號再直白不過:企業若透過合法渠道購買或取得授權數據來訓練模型,將受到法律保護;但若為圖方便依賴盜版途徑,就必須承擔極高的侵權代價。15億美金就是一個血淋淋的標價牌。這直接重塑了AI訓練數據供應鏈的合規框架,以後所有公司在構建數據集時,都不得不先問一句:這些數據,來路乾淨嗎?
案件的回響遠未結束。Anthropic和解案的漣漪效應正在擴散,它幾乎是一部預演的教科書,為正在進行的其他巨頭版權訴訟提供了參照坐標。OpenAI與《紐約時報》等媒體的交鋒、Meta被多名作家集體起訴的案件、Midjourney因抓取藝術家作品而被關注的圖像版權糾紛……都將是市場下一波緊盯的焦點。這些案件各自爭點或許不同,但Anthropic案所確立的“獲取合法性決定一切”的原則,幾乎注定會成為這些後續審判中控辯雙方反復撕扯的標尺。創作者一方看到了紅線被明確框定的希望,而AI公司則被迫從“先抓數據再想對策”的模式,轉向事前構建合法數據護城河。
這一切所勾勒的,其實是一個正在快速定型的AI版權新秩序。過去數年,生成式AI幾乎在數據使用的灰色地帶野蠻生長,許多模型建立在對互聯網公開及半公開信息的無差別吸納之上。如今,一扇窗被關上了,另一扇合規交易的大門則被徹底推開。出版商和大型版權持有者在經歷了最初被無償侵權的憤怒後,開始手握一張前所未有的議價籌碼,可以期待通過授權機制重新奪回自身內容的價值定價權。而對AI產業而言,高昂的和解金額也是一記成本警鐘:算力之外,數據合規成本將成為模型競爭之中不可回避的新壁壘,草莽英雄的時代正在落幕,一個更需要契約精神和法律精密計算的階段剛剛到來。

