本篇對應 Stanford CS221, Autumn 2025, Lecture 18,2025-11-19 由 Percy Liang 主講。課程版本與作業以官方網站為準,本講主要材料是 society。以下依 main() 的可執行順序閱讀,不把它擴寫成一篇泛論 AI 倫理;材料沒有提供的數據和結論會保留為缺口。
這一講的問題
從技術面轉向社會面
講義先回顧前面的技術主題:機器學習、狀態模型、機率推理與邏輯推理。狀態模型包括確定性的搜尋、不確定的馬可夫決策過程(MDP)與有對手的賽局;推理主題包括貝氏網路、命題邏輯與一階邏輯。第 18 講把問題轉向 AI 的社會面:模型不只是在算,還會和人、制度、資源與權力互動。
讀講義時要追的契約
CS221 的讀法仍然是追一個方法的契約:輸入如何表示、推論需要什麼資訊、輸出最佳化哪個目標,以及計算成本花在哪裡。本講把契約延伸到模型之外:資料從誰而來、誰控制計算、誰決定允許哪些請求、誰承擔錯誤,以及哪些群體被指標看見。這是分析框架,不是涵蓋所有 AI 社會問題的答案。
為什麼技術人員要在意社會
技術會改變社會
第一個理由是技術具有巨大影響。講義舉網際網路、手機與社群網路為歷史例子,並把 AI 描述為成長速度特別快的技術,再以 ChatGPT 每週八億活躍使用者說明規模。這個數字應讀成來源的時間快照:OpenAI 在 2025-11-12 的官方說明寫的是「每週」八億人,不是永久有效的即時統計,也不代表每個人使用相同功能。這些是材料引用的外部說法;它們在此只用來說明技術會進入許多人使用的系統,不是本篇自行估算。
技術人員擁有選擇權
第二個理由不是工程師能控制所有後果,而是技術人員確實做出會改變可及性的選擇:他們理解能力與限制,挑選要解決的問題,也決定設計方向。講義問:要支援哪些語言,例如英語、西班牙語和中文?要不要公開基礎模型權重?哪些請求應該允許?答案會改變誰能使用系統、能做什麼,以及風險如何分配。
把後果交給別人不是中性選擇
講義用 Wernher von Braun 作為極端例子:他曾協助希特勒在第二次世界大戰期間發展火箭,後來又到美國發展太空計畫;材料並引用 Tom Lehrer 的〈Wernher von Braun〉,反諷火箭升空後落在哪裡「不是我的部門」。重點不是每個工程師都要獨自承擔所有下游結果,而是拒絕討論後果並不會讓技術和後果真正分離。
高層原則
目標與既有宣言
講義的廣泛目標是確保 AI 為社會帶來利益而不是傷害。HHS 的 Belmont Report說明這不是新問題:1979 年形成的報告旨在保護人類研究對象,提出尊重個人、行善與正義。Tuskegee 的具體歷史則應看 CDC 的官方說明:1932–1972 年的研究讓非裔美國男性在未被充分告知的情況下持續被觀察,且在可治療的青黴素出現後仍未獲得治療;它是促成制度反省的背景之一,不宜把 Belmont 簡化成只由單一事件直接「產生」。
原則如何落地
材料也列 ACM Code of Ethics:促進人類福祉、避免傷害、誠實、公平、為作者提供功勞、尊重隱私、履行保密。這些原則看似無可反對,難點是如何在資料集、模型、產品與部署流程中操作化。這裡要分開:前句是講義提供的規範性方向;後面的審計、多指標、透明度與開放性,是把原則轉成可觀察問題的嘗試,不是已證明的解法。
雙重用途技術
定義與歷史類比
開發者不能完全控制 AI 的使用。Dual use technology 是既能使人受益、也能傷害人的技術。講義的例子是:氨可用於農業或化學武器;火箭可用於太空探索或彈道飛彈;核能可用於核能或核武器;資安工具可用於滲透測試或網路攻擊;加密可保護隱私或掩護犯罪活動。AI 也屬於雙重用途技術。
仍然可以引導方向
這不表示所有結果都一樣不可避免。講義仍主張可以把 AI 往有益方向引導,只是不能假裝能完全鎖死用途。實際工作因而要分辨:哪些應積極發展,哪些濫用需要防護,哪些非預期後果需要更謹慎的設計與監測。
效益、誤用與事故
效益
講義用「意圖」與「影響」兩個軸分類 AI 對社會的作用。Benefits 是可主動發展的有益用途。生物醫學科學面,AlphaFold3 可預測藥物或配體如何與蛋白質結合,以加速藥物開發;醫療面,AI 可對電子健康紀錄問答、協助和病人溝通。教育面包括個人化學習、課程設計與自動評分,但材料特別提醒 pedagogical:不只是完成任務,也要考慮教學。
機器人例子是已在今天出現的自駕車,以及進行中的高齡人口家用機器人。天氣方面,短期預測可支援早期警報;氣候方面,長期預測可監測排放與減緩策略有效性。這些是材料列出的方向,不是對每個應用效果的保證。
誤用
Misuse 是有害行為者明確用 AI 傷害他人。講義舉 AI agent 網路攻擊,以及用逼真文字、圖片、音訊、影片製造錯誤資訊;deepfake 是其中的影音例子,行為者可從國家到青少年。這一分類看的是意圖:同一能力可能有益,但故意用來傷害時屬於 misuse,不應混稱為模型事故。
事故
Accidents 是非預期後果,開發者和使用者都不希望發生。例子包括:人口群體不平等,例如語音助理對有口音者較不有效;諂媚,反覆肯定錯誤信念,對心理健康或自我傷害問題尤其令人擔心;過度依賴,例如教育中人變得不能自行批判思考;文化同質化,強化既有偏見與刻板印象;以及工作,AI 取代部分工作職能,例如入門級軟體工程師的職能。
三分類導出三個方向:效益要更多地做,誤用要設置防護並盡力阻止,事故要更小心。這不是保證防護成功,也不是把所有事故歸咎於使用者,而是讓介入方式對準意圖與影響的來源。
生態系統視角
為什麼模型行為不夠
理解 AI 影響、找出讓影響更正面的介入點,不能只看模型和行為。講義要求 ecosystem view:模型由資料與計算建立,再被人拿來產生利益或傷害;問題可能在輸出、上游資料與資源,也可能在下游使用和權力關係。
上游
模型由資料和計算建立,資料來自人。上游風險包括人的資訊可能被無意揭露(隱私)、創作者可能沒有適當補償(著作權)、工作者可能被不良對待(勞動實務)。計算來自環境資源開採,涉及能源、材料、排放、用水與資源開採的環境影響。講義在此只列出節點,沒有提供各項影響的數據比較。
下游
人使用 AI 來獲益或造成傷害。下游可能出現某些人比其他人得到更多幫助、產生有毒內容或採取有害行動;人也可能依賴系統而不能自行思考,部分工作職能可能被取代。完整視角使問題從「模型答對嗎」擴大到資料如何取得、如何部署、誰使用、誰承擔成本,以及哪一環能被審計或改變。
不平等與偏差
人口群體不平等
GenderShades 是 Buolamwini 與 Gebru 2018 年的研究;論文摘要報告三個商用性別分類系統在膚色與性別交叉群體間有顯著差異,最容易被誤分類的是深色皮膚女性。材料說研究公開後系統都有改善,並以第三方 auditing 說明外部測試能激勵公司降低不平等;這是講義的敘述,不應擴張成所有後續系統都已公平。策略有兩類:資料面為代表不足群體蒐集更多資料;演算法面提高代表不足群體權重,或使用 distributional robust optimization。
講義還問:性別分類是否是定義良好的任務?若性別包含自我認同,把它當固定標籤預測可能先定義錯問題。這不是材料在此給出的答案,而是提醒公平不只比較分數,也要檢查測量概念是否合理。
全球偏差與代表性
Starling 7B 是從 Llama2 7B Chat 微調而來、用於語言模型後訓練的 reward model。講義指出它對西方國家給出的 reward 高於非西方國家。這描述的是該 reward model 的差異,不是對所有模型或文化的普遍結論;要問的是,當「好答案」由某些資料和偏好定義時,哪些地區與思想被納入,哪些被低估。
偽相關
Spurious correlations 是訓練資料中的模式,卻不能泛化。胸腔引流管影像是講義案例;資料線索可能讓模型學到不希望的關聯,少數子群體往往承受最大影響。整體準確率看似良好,仍可能在不同群體或條件下失效。因此教訓是永遠監測多個指標、觀察不同子群體。材料沒有給出完整公平定義,也沒有說增加資料或換演算法必然解決偏差。
對齊
對齊的基本配方
Alignment 是如何讓 AI 做我們希望它做的事。強化學習配方是先定義能捕捉價值的 reward function,再訓練 agent 最大化預期 reward。問題隨即出現:寫下的 reward 真代表想要的結果嗎?不同人是否共享一套價值?人能否檢查模型行為?
Reward hacking
OpenAI 2016 年 CoastRunners 案例中,目標是讓船競賽,reward 卻是可透過撞擊取得的分數;學到的 policy 反覆繞港口、不完成賽事卻持續得分。這就是 reward function 沒捕捉真正目標。講義把問題帶到程式碼:程式通過永遠不完整的單元測試;正確卻不安全;正確安全卻風格差、複雜度高。要「做我想的,不只做我說的」很難形式化,過度最佳化會放大不完整指標。
Pluralism
Pluralism 表示不同人有不同價值。講義的規範方向是模型應在 Overton window 內呈現思想多樣性,並能個人化;但不能諂媚,也要避免 echo chamber。它沒有提供代表所有人的單一 reward,反而把「沒有唯一 reward」視為對齊難題。描述性挑戰是價值多元,規範性方向是承認多元而不把迎合誤當尊重。
Scalable oversight
語言模型能解決複雜問題,最終或已經可能產生專家難以驗證的答案。一般人如何評估?材料列出想法而非完成配方:把大問題拆成小問題;使用 AI,例如兩個 AI 辯論或 constitutional AI;監督過程而非只監督結果。總結是:reward 不是我們真正想要的(reward hacking);沒有唯一 reward(pluralism);而且很難寫出或檢查 reward(scalable oversight)。
著作權與生成式 AI
智慧財產制度
講義指出生成式 AI 有許多主要圍繞著著作權的訴訟,並列出 Anthropic 支付作者 15 億美元和解的材料。這裡保留案件的身分與結果區分:Bartz v. Anthropic 的法院核准命令記載的是 15 億美元加利息的和解基金;和解不是法院對所有生成式 AI 訓練都違法的判決,也不會自動替其他案件建立相同結論。智慧財產法的目標是激勵智慧成果創作,類型包括著作權、專利、商標、營業秘密;本講主要深入著作權。
著作權的範圍
英國 1709 年 Statute of Anne 被材料視為早期由政府與法院規範著作權的例子;美國較近期是 1976 Copyright Act。著作權保護固定在有形表達媒介上的原創作者作品,只要可直接或藉機器被感知、重製或傳達;保護表達而非想法,例如 quicksort。電話簿等集合通常不可保護,除非選擇或編排有創意;範圍從 1909 的「已出版」擴至 1976 的「已固定」。依 美國著作權局的說明,保護通常在作品創作並固定時自動產生,不以登記為前提;但這是美國法的說法,其他司法管轄區與不同作品不能直接套用。
在美國,作品受保護不等於起訴條件相同:Copyright Office 的說明指出,美國作品通常要先完成登記,或在被拒絕後依法律程序,才能在聯邦法院提起侵權訴訟;單純送出申請不必然等於已完成登記。講義列的 65 美元是來源當時的 Standard Application 費用快照,不是所有申請類型的固定價格;費用頁目前列出電子 Single Application 為 45 美元、Standard Application 為 65 美元,群組申請又各有不同費用。保護期限也不是平坦的 75 年:依 Copyright Office 的期限說明,1978 年後創作的多數作品通常是作者終身加 70 年,匿名、假名或職務作品通常是首次發表 95 年或創作 120 年取較短者;更早作品還要看出版、登記與法律變遷。因此何時進入公共領域必須按司法管轄區、作品種類與創作/發表時間判斷,不能用莎士比亞、貝多芬或 Project Gutenberg 的例子概括所有網路內容。講義的保守結論仍成立:網路上的內容不應預設為沒有著作權。
授權
使用受保護作品的路徑是取得授權或主張 fair use。授權來自契約法,由 licensor 給 licensee;材料用「不提告的承諾」概括。Creative Commons 不是把作品變成沒有權利人的公共領域,而是讓權利人預先按指定條件授權。講義列的 Flickr 三億零七百萬、MusicBrainz 三千九百萬、YouTube 一千萬,應標成 2014 年 11 月左右的舊快照,而不是現在的存量;Creative Commons 的 State of the Commons 2015 資料已提供不同時間點與估算方法(例如 Flickr 356 million、YouTube 13 million),也提醒這些是平台與搜尋資料推估的作品數,不能混稱為同一種「圖片」。Lessig 與 Eldred 等人於 2001 年建立 Creative Commons 的歷史,可見 官方歷史頁。
模型資料授權例子包括 Google/Reddit、OpenAI/Shutterstock、OpenAI/StackExchange。這些是材料列的案例,不是本篇對合作法律效果的獨立判斷。
Fair use
第 107 條的四因素是:使用目的與性質(教育勝商業、轉化勝複製);作品性質(事實勝虛構、非創意勝創意);使用份量與重要性(片段勝整部);以及對原作或潛在市場的影響,詳見 Copyright Office 的 fair-use 說明。這些是衡量因素,不是「教育就一定可以」「少於某比例就一定可以」的分類規則;法院會依個案整體判斷。例子是看電影寫摘要、重做演算法的想法而不複製程式碼、Google Books 建索引並顯示片段(Authors Guild v. Google)。著作權不只關逐字記憶:Harry Potter 的情節與角色可能受保護,戲仿在特定脈絡下可能受 fair use 保護;核心仍是法律分析,而不是保證結果。
基礎模型的考量
訓練第一步是複製資料,即使不再做其他事,複製是否已違規就可能是問題;另一方面,訓練是轉化性的,遠非複製貼上,模型學的是 stop sign 這種想法,而非某張圖片的確切藝術選擇。可是基礎模型確實可能影響作家、藝術家的市場,不論最後是否構成侵權。因此法律問題和市場、工作問題不能混成一題;講義沒有替每個案例下法律結論。
服務條款
有授權或可主張 fair use,服務條款仍可加限制。例子是 YouTube:影片可能以 Creative Commons 授權,但 YouTube 條款仍限制下載、重製或使用服務內容,除非服務明確允許、取得 YouTube 與相關權利人的書面許可,或適用法律允許;條款同時明確保留使用可嵌入 YouTube player 播放器的例外。這不是「所有下載都違法」的法律結論,而是平台服務權限、API/嵌入播放器例外與個別作品授權要分開看。法律上的使用權和平台契約條件不是同一件事。
記憶與抽取
Memorization 問文字是否在模型權重中,可看 (p(\text{book}[i] \mid \text{book}[1:i-1]));材料指出 Llama 3 70B 對 Harry Potter 的機率遠高於隨機。Extraction 問使用者能否真的取出文字;用「Mr. and Mrs. D」提示,模型可能透過滑動視窗產生整本 Harry Potter。尤其若容易抽取,講義認為侵權案例更強。
開放性與透明度
誰能決定與建造
講義從「模型應做什麼」問到誰能決定模型行為、誰能建造模型。風險是權力集中:很少數大型科技公司能建造 frontier models,而且外界知道它們如何運作的內容很少。這是決策權與建造能力的治理問題,不只是模型品質。
透明度
Transparency 是前提:不能測量就不能改善。Foundation Model Transparency Index(FMTI)以 100 個指標評估開發者,涵蓋上游、模型與下游屬性;材料呈現子領域、整體與比較分數。其 theory of change 是公開報告會激勵公司更透明。描述性證據到此為止:有指標、報告和提出的激勵路徑;講義沒有說透明度必然造成安全或公平。
開放性
基礎模型 openness 是光譜。重要性包括:研究者與開發者有更多創新和客製化;透明度增加但仍不足;權力集中降低。風險分析要比較閉源模型、網際網路等替代方案的 marginal risk,也要看全生態系,因為設計、生產、部署可能共同促成生物武器。因此開放不是無條件答案,透明也不是開關;總結是需要更多清晰度與測量。
總結
技術人員要關心社會影響,因為 AI 會進入真實場景,而技術人員選擇問題、語言、權重與請求邊界。AI 是雙重用途技術:應發展有益應用、以防護遏止誤用,並對事故更謹慎。要用生態系統視角看資料、計算、勞動、環境、模型、部署、使用者與下游傷害。
具體工具包括跨子群體監測多指標、第三方審計、區分 reward hacking/pluralism/scalable oversight,在著作權上區分複製、轉化、授權、fair use、條款、記憶和抽取,以及把透明度、開放性當作可測量的治理問題。下一講會深入看 AI 生態系的參與者。
材料缺口
本文以 society.py 與原有官方連結為主,並在有必要的地方補上可核對的權威來源。官方講義與影片公開;Canvas 互動、作業解答、隱藏測資不公開。因此沒有替 GenderShades、全球 reward 差異、胸腔引流管、FMTI 或法律爭議補上未提供的數據,也沒有把規範方向寫成已證明的因果結論。材料列出案例和策略,卻沒有完整公平定義、全面部署規則或每項策略的成效比較;法律段落也只描述美國法的幾個重要分界,不能當成跨國法律意見。這些保留為缺口。
參考資料
Loading...