2026.10.02 09:00 臺北時間

徐淑卿專欄/AI看書需要花錢嗎?

mm-logo
專欄
AI不經授權而直接抓取內容的作法,未來可能必須付出代價。最重要的是,內容方如果默認對方可以無償取用,那內容的價值就無法隨著AI的蓬勃水漲船高。現在,如何讓文化與知識產業進入AI經濟,也許是更值得思考的方向。(圖/陳克宇)
AI不經授權而直接抓取內容的作法,未來可能必須付出代價。最重要的是,內容方如果默認對方可以無償取用,那內容的價值就無法隨著AI的蓬勃水漲船高。現在,如何讓文化與知識產業進入AI經濟,也許是更值得思考的方向。(圖/陳克宇)
9月15日台灣數位發展部召開記者會,宣布啟動「臺灣主權AI訓練語料庫」民間語料徵集活動,徵集原則是「自願參與、明確授權、可退出」。
點按看下一則延伸閱讀文章
而後大塊文化董事長郝明義在臉書提出不同看法。他認為既然此事對台灣如此重要,就應該從戰略、政策、預算三位一體清晰積極的推進計畫。他認為目前數發部希望大家「無償授權」的作法太被動,如同「聲稱要建設光華奪目的圖書館,卻不編購書預算,只要大家免費捐贈。」
早在今年3月,《報導者》即刊出一篇文章〈和解案後,未解的台灣主權AI語料困局:開發者和內容方能否終結授權衝突?〉,討論開發者和內容方的不同立場。內容方多認為著作權有價是普世價值,但從開發者的角度,如何解決大大小小內容方的授權問題,恐怕事務繁瑣難以周全,而且緩不濟急。
文章中兩位科技法律與著作權法專家林誠夏與李姿儀提出一個可能的解方,將「資料探勘」視為著作權例外(Text and Data Mining Exception),來解決訓練生成式AI模型所產生的著作權爭議。但是必須有揭露資料來源的透明性,如果不排除適用在營利目的,就必須有報酬分配機制。林誠夏認為:「營利不是一件壞事,營利以後沒有公平分配給原來的付出者才是壞事。」
李姿儀則建議,營利目的的使用,應由政府輔助建立執行機制:「可以成立一個專責機構,讓AI開發者定期通報內容使用的情形,由它來通知著作權人、處理報酬分配,解決個別授權的交易成本過高的問題。」
為什麼在構建「臺灣主權AI訓練語料庫」時,希望民間「無償授權」共襄盛舉?是因為「沒有預算」,還是「目前沒有打算編列預算」?在這篇文章中,也許可以看出數發部長林宜敬的想法,以及不能因為有爭議就裹足不前,所以他的態度是,採用現行沒有著作權疑慮的內容,可能就是最好的方法。
他一方面指出,未來五年內不會推出相關修法。因為AI拿著作權內容去訓練,是否合乎著作權法,至少要吵五年,要形成社會共識很難。
此外,他提出一個反問。AI透過調整神經元參數進行訓練,本質上是「仿生腦」。如果真人消化100篇文章後,寫出一篇文章來,沒有侵犯著作權。一個仿生腦,看了10000篇文章後,寫出一篇文章,若用這個類比,「我們覺得沒有侵犯著作權」。
「如果Google僱用了真人,每天在看新聞摘要、寫出一篇新的文章,你不會說是抄襲。現在,事情自動化、變成AI,那到底對還是不對?我也不敢講說不對。這已經挑戰到人類存在的意義。」
因為是從報導中看到他的陳述,也許未必體現他思考的全貌。不過僅就上述想法,可能就會產生各種不同意見。比如,真人寫作和AI寫作是一樣的嗎?真人學識與寫作的積累,難道是無償取得的嗎?求學、買書、訂閱報紙期刊都有價,甚至現在到公共圖書館借書,政府都試行對出版社和作者付費。更不用說,若有AI公司使用這個語料庫進行商業利用,內容方也無法分享利潤嗎?
不過,這些暫且不論,若從內容價值的角度來看,「無償授權」最致命的影響是,它可能會扼殺內容在AI時代的榮景。
過去已經有很多人質疑,為什麼AI公司願意投資算力、人才,但對資料就希望免費,甚至寧可遊走在侵犯著作權的灰色地帶?誠然,若要一個一個談授權,幾乎不可能,但現在已經有一些組織可以代勞。其次,當大量免費或容易抓取或公開語料庫的內容,形成語言模型的訓練基底時,現在品質高的內容,將更顯其珍稀性,應該並可能取得與其價值相應的收益。所以也許現在要做的是,建立新的遊戲規則,而不是過去隨意圈地,如今依然墨守成規。
今年3月英國出版協會發布一篇報告〈內容超級強國:英國出版業與AI授權市場〉(Content Superpower: UK publishing and the
AI licensing market)。文章中指出,出版內容的AI授權市場已經成形且正在成長,所以英國政府不需要,也不應該為AI訓練新增「著作權例外」。
報告從學術、大眾與教育三個領域,論證英國何以是內容強國,並強調英國數十年來持續投資高品質內容的開發。比如學術出版,會協調同儕審查,品質控管,抄襲檢查,避免論文工廠與學術詐欺。而在大眾出版方面,需要發掘並培養作者,承擔新聲音的風險,並透過編輯過程讓作者的文字完整實現。
根據他們對會員的調查,出版社將內容授權於商業用的文字與資料探勘約有十年,第一批AI訓練授權則在2023年出現,預計到今年底,所有主要學術出版社都會以某種形式進入市場。
買方主要是美國大型科技公司。
出版內容被視為資料的「黃金標準」,原因正是出版流程的驗證與篩選,和從網路抓取的低品質內容形成對比。
此外,市場從純粹訓練轉向RAG(Retrieval-Augmented Generation,檢索增強生成。結合大型語言模型與外部資料庫檢索,再根據檢索內容生成答案的技術)。RAG交易經常按使用量計費,形成定期收入,多數已簽約的出版社預期2026年RAG收入,將會成長超過10%。
今年5月,韓國大韓出版文化協會新任會長金泰憲(김태헌,暫譯)在記者會中,提出一個新詞「AI讀者」。他也指出在建構主權AI的過程中,書籍作為高品質的學習資料,價值正在提高。
他說,大韓出版文化協會將建立一套制度,讓書籍在學習資料流通的過程中,能夠獲得著作權保護,以及合理的報酬。「我們將建立以作者與出版社權利為前提的利用體系。」
大韓出版文化協會去年提供給韓國數據產業振興院的內容,價值約36億韓元(約8400萬台幣)。為了擴大相關產業,協會也已向文體部提出要求,希望政府提供預算支援等方面的協助。
內容方必然會主張自己的權利,也無法坐視自己的成果長期被竊取。現在更會意識到在AI時代中,內容方必須介入到產業結構中,隨著AI擴大的市場一起成長。
但的確有許多問題需要解決。比如AI科技公司不太可能逐個跟內容方談授權,除非是規模非常大的公司。因此英國已有代表出版社與作者的授權機構,正在建立與AI相關的集體授權,讓小出版社也能加入。
挪威就是用這種方式。今年5月挪威國家圖書館與集體版權管理組織Kopinor,宣布就使用書籍內容訓練語言模型的協議條件達成共識。
今年1月挪威國家圖書館已經以報紙內容來訓練語言模型,這是政府一年花4500萬挪威克朗(約1.5億台幣)取得的授權。與Kopinor的書籍內容使用協議談判,則在今年3月達成共識,但協議是否成立,仍要看2027年國家預算是否編列相關經費。
Kopinor 執行長海格·孟克·根德森(Hege Munch Gundersen) 說,雖然有許多理由對生成式AI抱持懷疑,但是對Kopinor來說,參與其中仍是正確的選擇。一方面要將權利人的觀點,納入AI的協議制度中;另一方面,也要讓文化與知識產業進入AI經濟。
這份協議設計了一些限制。比如只涵蓋數位化書籍中的文字內容;對於一些容易因為語言模型使用而受影響的書籍,不在授權範圍內。
挪威國家圖書館訓練完成的語言模型,在後續授權方面附有若干條件。包括,不得利用這些模型建立自動生成書籍的服務,也不得生成模仿特定作者風格的內容。此外,權利人保有拒絕參與的權利。
荷蘭在內容授權上也有突破。今年荷蘭的國家語言模型GPT-NL,進入真實環境測試。英國科技媒體《Computer Weekly》在〈荷蘭讓GPT-NL 從實驗室走向實際應用〉(Netherlands moves GPT-NL from lab to live: first pilots under way)報導中指出,也許最具國際意義的進展不在技術層面,而是在法律上。
GPT-NL已經與荷蘭新聞媒體協會達成一項授權協議。涵蓋的媒體包括全國性報紙、NU.nl 與 RTL News等平台,以及廣播媒體BNR。GPT-NL宣稱,這是全球第一個在單一市場中,為了將出版商的內容用於語言模型訓練,而與所有主要出版商達成經雙方同意的付費協議。
文章中說,這項協議得來不易。在大型語言模型的時代,新聞媒體可能是損失最大的產業之一。它們的內容遭到大規模抓取,事前沒有獲得許可。這些內容接著又被用來生成新的內容,直接與新聞報導形成競爭。
荷蘭新聞媒體協會主席 Rien van Beemen表示:「我們建立了一個先例。長期而言,它將強化荷蘭新聞業的地位。AI 創新可以用合乎倫理的方式進行,而不必大規模非法使用新聞工作者的作品。」
可以想見,台灣數發部採取無償授權方式,許多高品質的內容不會輕易釋出,對於建構語料庫實屬可惜。而從文化部的立場,若從文化內容可以在AI時代創造更多價值的角度思考,也許顯現的路徑與需要解決的問題會截然不同。
總之,過去AI不經授權而直接使用內容的情況可能過時,也越來越可能需要付出代價。最重要的是,內容方如果默認對方可以無償取用,那內容的價值就無法隨著AI的蓬勃而水漲船高。因此如根德森所說,讓文化與知識產業進入AI經濟,也許是更值得思考的方向,而且可以從政府做起。
更新時間|2026.10.02 09:00 臺北時間
延伸閱讀

支持鏡週刊

小心意大意義
小額贊助鏡週刊!

每期 $35 元動態話題報導
無限閱讀解鎖新鮮事

更多內容,歡迎 鏡週刊紙本雜誌、鏡週刊動態雜誌、了解內容授權資訊。

獨家深度分析報導

線上閱讀

更多內容,歡迎 鏡週刊紙本雜誌、鏡週刊動態雜誌、了解內容授權資訊。

獨家深度分析報導

線上閱讀