他一方面指出,未來五年內不會推出相關修法。因為AI拿著作權內容去訓練,是否合乎著作權法,至少要吵五年,要形成社會共識很難。
此外,他提出一個反問。AI透過調整神經元參數進行訓練,本質上是「仿生腦」。如果真人消化100篇文章後,寫出一篇文章來,沒有侵犯著作權。一個仿生腦,看了10000篇文章後,寫出一篇文章,若用這個類比,「我們覺得沒有侵犯著作權」。
「如果Google僱用了真人,每天在看新聞摘要、寫出一篇新的文章,你不會說是抄襲。現在,事情自動化、變成AI,那到底對還是不對?我也不敢講說不對。這已經挑戰到人類存在的意義。」
因為是從報導中看到他的陳述,也許未必體現他思考的全貌。不過僅就上述想法,可能就會產生各種不同意見。比如,真人寫作和AI寫作是一樣的嗎?真人學識與寫作的積累,難道是無償取得的嗎?求學、買書、訂閱報紙期刊都有價,甚至現在到公共圖書館借書,政府都試行對出版社和作者付費。更不用說,若有AI公司使用這個語料庫進行商業利用,內容方也無法分享利潤嗎?
不過,這些暫且不論,若從內容價值的角度來看,「無償授權」最致命的影響是,它可能會扼殺內容在AI時代的榮景。
過去已經有很多人質疑,為什麼AI公司願意投資算力、人才,但對資料就希望免費,甚至寧可遊走在侵犯著作權的灰色地帶?誠然,若要一個一個談授權,幾乎不可能,但現在已經有一些組織可以代勞。其次,當大量免費或容易抓取或公開語料庫的內容,形成語言模型的訓練基底時,現在品質高的內容,將更顯其珍稀性,應該並可能取得與其價值相應的收益。所以也許現在要做的是,建立新的遊戲規則,而不是過去隨意圈地,如今依然墨守成規。
今年3月英國出版協會發布一篇報告〈內容超級強國:英國出版業與AI授權市場〉(Content Superpower: UK publishing and the
AI licensing market)。文章中指出,出版內容的AI授權市場已經成形且正在成長,所以英國政府不需要,也不應該為AI訓練新增「著作權例外」。
報告從學術、大眾與教育三個領域,論證英國何以是內容強國,並強調英國數十年來持續投資高品質內容的開發。比如學術出版,會協調同儕審查,品質控管,抄襲檢查,避免論文工廠與學術詐欺。而在大眾出版方面,需要發掘並培養作者,承擔新聲音的風險,並透過編輯過程讓作者的文字完整實現。
根據他們對會員的調查,出版社將內容授權於商業用的文字與資料探勘約有十年,第一批AI訓練授權則在2023年出現,預計到今年底,所有主要學術出版社都會以某種形式進入市場。
出版內容被視為資料的「黃金標準」,原因正是出版流程的驗證與篩選,和從網路抓取的低品質內容形成對比。
此外,市場從純粹訓練轉向RAG(Retrieval-Augmented Generation,檢索增強生成。結合大型語言模型與外部資料庫檢索,再根據檢索內容生成答案的技術)。RAG交易經常按使用量計費,形成定期收入,多數已簽約的出版社預期2026年RAG收入,將會成長超過10%。
今年5月,韓國大韓出版文化協會新任會長金泰憲(김태헌,暫譯)在記者會中,提出一個新詞「AI讀者」。他也指出在建構主權AI的過程中,書籍作為高品質的學習資料,價值正在提高。
他說,大韓出版文化協會將建立一套制度,讓書籍在學習資料流通的過程中,能夠獲得著作權保護,以及合理的報酬。「我們將建立以作者與出版社權利為前提的利用體系。」
大韓出版文化協會去年提供給韓國數據產業振興院的內容,價值約36億韓元(約8400萬台幣)。為了擴大相關產業,協會也已向文體部提出要求,希望政府提供預算支援等方面的協助。
內容方必然會主張自己的權利,也無法坐視自己的成果長期被竊取。現在更會意識到在AI時代中,內容方必須介入到產業結構中,隨著AI擴大的市場一起成長。
但的確有許多問題需要解決。比如AI科技公司不太可能逐個跟內容方談授權,除非是規模非常大的公司。因此英國已有代表出版社與作者的授權機構,正在建立與AI相關的集體授權,讓小出版社也能加入。
挪威就是用這種方式。今年5月挪威國家圖書館與集體版權管理組織Kopinor,宣布就使用書籍內容訓練語言模型的協議條件達成共識。
今年1月挪威國家圖書館已經以報紙內容來訓練語言模型,這是政府一年花4500萬挪威克朗(約1.5億台幣)取得的授權。與Kopinor的書籍內容使用協議談判,則在今年3月達成共識,但協議是否成立,仍要看2027年國家預算是否編列相關經費。
Kopinor 執行長海格·孟克·根德森(Hege Munch Gundersen) 說,雖然有許多理由對生成式AI抱持懷疑,但是對Kopinor來說,參與其中仍是正確的選擇。一方面要將權利人的觀點,納入AI的協議制度中;另一方面,也要讓文化與知識產業進入AI經濟。
這份協議設計了一些限制。比如只涵蓋數位化書籍中的文字內容;對於一些容易因為語言模型使用而受影響的書籍,不在授權範圍內。
挪威國家圖書館訓練完成的語言模型,在後續授權方面附有若干條件。包括,不得利用這些模型建立自動生成書籍的服務,也不得生成模仿特定作者風格的內容。此外,權利人保有拒絕參與的權利。
荷蘭在內容授權上也有突破。今年荷蘭的國家語言模型GPT-NL,進入真實環境測試。英國科技媒體《Computer Weekly》在〈荷蘭讓GPT-NL 從實驗室走向實際應用〉(Netherlands moves GPT-NL from lab to live: first pilots under way)報導中指出,也許最具國際意義的進展不在技術層面,而是在法律上。
GPT-NL已經與荷蘭新聞媒體協會達成一項授權協議。涵蓋的媒體包括全國性報紙、NU.nl 與 RTL News等平台,以及廣播媒體BNR。GPT-NL宣稱,這是全球第一個在單一市場中,為了將出版商的內容用於語言模型訓練,而與所有主要出版商達成經雙方同意的付費協議。 文章中說,這項協議得來不易。在大型語言模型的時代,新聞媒體可能是損失最大的產業之一。它們的內容遭到大規模抓取,事前沒有獲得許可。這些內容接著又被用來生成新的內容,直接與新聞報導形成競爭。
荷蘭新聞媒體協會主席 Rien van Beemen表示:「我們建立了一個先例。長期而言,它將強化荷蘭新聞業的地位。AI 創新可以用合乎倫理的方式進行,而不必大規模非法使用新聞工作者的作品。」
可以想見,台灣數發部採取無償授權方式,許多高品質的內容不會輕易釋出,對於建構語料庫實屬可惜。而從文化部的立場,若從文化內容可以在AI時代創造更多價值的角度思考,也許顯現的路徑與需要解決的問題會截然不同。
總之,過去AI不經授權而直接使用內容的情況可能過時,也越來越可能需要付出代價。最重要的是,內容方如果默認對方可以無償取用,那內容的價值就無法隨著AI的蓬勃而水漲船高。因此如根德森所說,讓文化與知識產業進入AI經濟,也許是更值得思考的方向,而且可以從政府做起。