
生成式 AI 快速發展,使模型如何學習成為全球法律爭議的核心。美國舊金山聯邦地方法院 7 月批准 AI 巨頭 Anthropic 以天價 15 億美元(約新台幣 480 億元)達成著作權集體訴訟和解,創美國著作權史上最高賠償金額紀錄。
這起訴訟由眾多知名作家聯署提出,指控Anthropic未經許可下載大量盜版書籍訓練AI聊天機器人Claude。本案落幕不僅是金錢賠償結算,更在司法層面為生成式AI劃下第一道清晰且具強制力的法律邊界。
這起歷史性訴訟的核心爭點,在於法院如何將AI的學習行為,與侵權蒐集切割。審理時法院做出重要認定:AI模型為了學習文法、字詞結構與人類語言概念而「閱讀」書籍,符合著作權法的「合理使用」(Fair Use)原則,不構成侵權。
法院認為,模型學習本質就像學生在圖書館閱讀書籍以汲取知識,這屬於轉化性利用。然而,Anthropic之所以遭高達15億美元的懲罰性和解金,關鍵在為了建立模型訓練庫,違法從影子圖書館(Shadow Libraries)下載並長期儲存超過700萬冊盜版書籍。這項認定建立一條極為重要的法理界線:法律保護AI對公開資訊的「閱讀與消化」,但絕不寬貸獲取資料時的盜版與非法拷貝。
傳統著作權法的合理使用原則,雖然勉強能涵蓋AI模型學習運算的轉化本質,卻無法直接當成違法蒐集原始資料的免死金牌。過去科技公司習慣以AI學習是為了創新為由,對訓練資料的合法性採取模糊帶過策略,但Anthropic案表明,資料來源的合法與否已成為不可逾越的法律紅線。
這也代表生成式AI造成的新型態利用行為,迫使法院將審查焦點從AI輸出什麼,向前延伸至資料從哪裡來。對全球智慧財產權體系而言,將來合理使用抗辯必須建立在乾淨資料源(Clean Data Provenance)前提上,一味主張合理使用已不足以抵禦資料來源瑕疵造成的巨額賠償風險。
本案理所當然衝擊全球企業的法遵策略與資料管理標準。對正在開發或調用大型語言模型的企業而言,這項判決確立三個不可逆轉的治理標準:首先是徹底摒棄非法網路抓取,企業建置訓練資料庫時,必須全面清查並刪除來自未授權或盜版管道的資料,建立嚴格的資料來源驗證機制;其次是導向授權與商業合作模式,包含OpenAI、Anthropic等頭部企業都加速轉向與新聞出版商、版權持有者簽署商業授權合約,將資料取得成本制度化,降低訴訟定時炸彈的威脅;最後則是建立合規的智慧財產管理體系,企業資安與法遵部門,必須建立訓練資料的透明軌跡紀錄,確保每筆訓練數據都能追溯是合法權源。
Anthropic這場15億美元的巨額和解,將是產業走向成熟與規範化營運的重要起點。司法機關以法理裁量,捍衛AI演算法學習運算的合理使用空間,確保科技創新的火苗不被阻斷;另一方面也用高昂代價警告全球市場,突顯尊重智慧財產權與維護資料源合法的必要性。
未來的全球AI競賽,模型演算法的突破固然重要,但誰能建立最嚴謹、最乾淨且具高度透明度的資料管理機制,誰才能在法律規範日益嚴格的全球市場,符合法規地釋放AI的巨大商業價值。
(首圖來源:shutterstock)