AI 雖帶給人們極大便利,卻也引發諸多爭議,例如捏造事實、侵犯著作權及隱私權等社會倫理及法律議題。經過數年的研議後,歐盟終於在 2024 年 3 月 13 日正式通過《[人工智慧法案](https://artificialintelligenceact.eu/the-act/)》(Artificial Intelligence Act,簡稱AI法案)。
這是世界首部直接規範人工智慧的法案,彰顯歐盟試圖主導全世界 AI 技術發展的決心。
如同《時代雜誌》報導,這部法案依照風險程度,將不同的人工智慧系統分級管理──風險愈高,受到的監管就愈嚴格;而像社會評分、預測罪犯行為等直接侵犯人民基本權利的系統,則被明文禁止。另外,政府只能在特定的重大犯罪案件,例如涉及恐怖攻擊時,才能使用 AI 加持的臉孔掃描技術來監控人民(註一)。
考量「能力越大、責任越大」,有了前述的分級管理,才能預防 AI 造成難以預測的風險,例如侵犯隱私、種族歧視、大規模網路攻擊等。
以下本文將聚焦著作權的問題,藉此談談本法案能否緩解 AI 帶來的衝擊。
## 被低估的著作權問題
隨著 AI 輸出的文字、圖片、影片品質愈來愈高,甚至開始威脅原本人類的工作,許多創作者開始質疑 AI 使用資料、訓練模型時,是否確實詢問過創作者的意願?這是否是對著作權赤裸裸的侵害?當 AI 公司以創新之名賺進大把鈔票時,可曾考慮過他人的權益?
試想,若有一個 AI 系統違反了規範,頂多是服務被勒令停止,但如果 AI 模型本身侵害了著作權,則會影響到所有使用此 AI 模型的服務,故筆者認為這是 AI 產業最大的一顆未爆彈。
話雖如此,即使初期有 AI 開發商不幸夭折,整個 AI 產業也一定會繼續發展。就如同大家熟悉的音樂產業,雖然帶領網路下載音樂的 Napster 已死(註二),線上音樂仍以串流的商業模式蓬勃發展。現今的 AI 公司中,誰將成為過往的 Napster,誰又能成為現在當紅的 Spotify 呢?
## 公開透明,是避免侵權的防腐劑
依照歐盟 AI 法案,AI 模型的開發商必須說明哪些資料被用於訓練 AI 模型,並提供「足夠詳盡的摘要」(sufficiently detailed summary),例如:
- 列舉用於訓練模型的主要資料集 - 提供其他資料來源的敘述性說明
在最初的立法草案中,其實只有要求公佈受著作權保護的資料即可,不過最終版本則擴大要求揭露所有訓練資料,以便第三方行使權利。根據 AI 法案,新成立的人工智慧辦公室(AI office)將會提供摘要的範本給外界參考。
對 AI 公司來說,雖然只被要求提供摘要,而非窮盡說明所有訓練資料,但由於大型 AI 模型往往使用數以億計的作品進行訓練;所以即便是摘要,對企業的負擔也十分巨大。
另外,由於許多資料集是由第三方提供,AI 公司可能永遠無法確認它們的原始來源及正確性。
這還不打緊,更嚴重的問題是,許多資料來源幾乎可以確定是非法的,例如 OpenAI 用於訓練 ChatGPT 的 Books2 資料集,被強烈懷疑來自俗稱「盜版書天堂」的影子圖書館,如 Libgen genesis;而 Meta 用以訓練 LLaMA 模型的 Books3 資料集,內容也是滿滿侵權書籍。
主動公開這些資料,不只會遭到輿論撻伐,也等於是把侵權證據向著作權人雙手奉上。這或許才是 AI 公司一直閉口不提訓練資料來源的真正理由。
我相信當初開發 AI 的研究人員可能沒想太多,或完全輕忽了著作權的風險。
就算撇開著作權不談,創作時如果參考了他人的內容或想法,也該列出出處以表揚有貢獻的創作者。這不只是約定成俗的慣例,也是基本的禮儀。即使生成式 AI 在技術上無法做到這點,起碼應該讓公眾知道產出的內容「可能」參考了哪些作品吧?
OpenAI 及 Meta 如果直接使用盜版內容來訓練 AI,又以窒礙難行當作藉口拒絕提供資訊,或是以阻礙創新為由威脅監管機構,可能難以服眾。
## 著作權人有說「不」的權利
除了前述規範,AI 法案還要求開發商必須遵守歐盟《[數位單一市場著作權指令](https://zh.wikipedia.org/zh-tw/%E6%95%B0%E5%AD%97%E5%8C%96%E5%8D%95%E4%B8%80%E5%B8%82%E5%9C%BA%E7%89%88%E6%9D%83%E6%8C%87%E4%BB%A4)》第 4 條 3 款。這個條款,讓第三方在進行「文字和資料探勘」(Text and Data Mining)時,不必擔心侵害著作權;但前提是,如果著作權人主動表示要「退出」(opt-outs),不想讓自己的創作被利用,AI 公司就必須尊重其意願。
法案採取這樣的作法,是很重要的決定,代表歐盟為了不阻撓 AI 產業的發展,允許廠商在符合法規的前提下,能用前述方式訓練模型。
不過下一個問題是:訓練 AI 模型涉及到成千上萬的著作權人,每個人表示「退出」的方式或許各有不同,而目前也不知道哪些「退出」方式是符合標準的,所以還須等待進一步的指引。
不過在 AI 法案中,已經明文要求開發商使用「最先進的技術」來辨識、尊重著作權人的退出要求(也許在網頁放置一段簡單的文字就足夠了?)。這似乎意味歐盟傾向把責任交給AI公司,畢竟他們才是現在佔人便宜的那一方,對吧?
過往當 AI 公司被質疑擅自使用他人創作時,最常見的抗辯就是:「向如此多的著作權人取得授權,是不可能的事」。但即使是為了追求創新,也至少該做合理的努力。舉例來說,OpenAI 提供了完整的說明,讓著作權人在網站使用 [robots.txt](https://zh.wikipedia.org/zh-tw/Robots.txt) 的標記,以避免被 OpenAI 的網路爬蟲給[索引](https://platform.openai.com/docs/gptbot)。
