書海Apsû
海圖 領航員 航海指南
登記成為航海者

書海 ApsûVoyage of a Thousand Books

選擇語言 · Choose your language

書海海圖

拖曳或縮放海圖,點一座島就能上岸

← 回到海圖

← 回到島上 · 羅弗敦群島
花楸
讀完書摘並留下漂流瓶,即可獲得花楸
登記後就能收集這隻生物
對齊問題(暫譯)
原文書名:The Alignment Problem
作者:布萊恩・克里斯汀 (Brian Christian) ⓘ
對齊問題(暫譯)

0:00
    我們該問的不只是「機器如何把獎勵最大化」,而是「我們該怎麼設計獎勵,才能讓它做出我們真正想要的事」。
    閱讀進度 80%
    ▶ 懶得看文字的人,這裡有說書影片:)
    ▶ 敬請期待說書影片
    前往羅弗敦群島

    適合誰看?

    • 想知道 AI 為什麼會學到偏見、又該怎麼修正的人
    • 對演算法公平、AI 透明度等社會議題有興趣的讀者
    • 學資訊、心理學或社會科學,想看兩個領域怎麼交會的學生
    • 想用故事而不是公式理解機器學習的人

    作者是何許人也?

    • 布萊恩・克里斯汀 (Brian Christian),美國作家,擅長把電腦科學與哲學、心理學寫給一般讀者
    • 曾與認知科學家湯姆・葛瑞菲斯合著《決斷的演算》
    • 本書英文原名 The Alignment Problem: Machine Learning and Human Values,2020 年出版

    其他書籍《決斷的演算》(Algorithms to Live By,與 Tom Griffiths 合著);The Most Human Human

    本書架構

    🔒 抵達羅弗敦群島拜訪花楸後,就能看完整內容

    前往羅弗敦群島
    全書架構:預言、能動性、規範

    本書分成三大部分,每部分三章,從基礎一路走到進階。

    第一部分「預言」談機器學習的預測系統,包含「表徵」、「公平」與「透明」三章;第二部分「能動性」談會自己行動的系統,包含「強化」、「塑造」與「好奇心」;第三部分「規範」談機器如何學會人類想要什麼,包含「模仿」、「推論」與「不確定性」。

    克里斯汀用大量研究者的訪談與真實案例,把技術問題和人類心理學、行為科學串在一起,讓沒有技術背景的讀者也能看懂。

    表徵:資料裡缺了誰

    第一章從一個知名事件開始:2015 年,Google 相簿的圖片分類器把黑人標記成「大猩猩」。原因是訓練資料裡的人臉樣本不夠多元。

    書中提到,Google 後來的處理方式不是補足多元的訓練資料,而是直接把這個標籤關掉。作者藉此說明,許多圖片資料庫長期以白人、男性為主,神經網路自然在其他族群身上表現較差。資料裡沒有誰,模型就看不見誰。

    公平:數學上不可能兩全

    第二章討論演算法公平。作者以刑事司法系統用來預測再犯風險、協助假釋判斷的工具為例,指出如果拿一個本來就有問題的制度產生的資料去訓練機器,機器只會把問題延續下去。

    更棘手的是,公平有好幾種定義,而且在數學上無法同時滿足。如果完全忽略種族,結果可能對黑人不利;如果把種族納入考量來追求結果平等,又可能對其他群體不公平。書中引用研究者莫里茲・哈特的話:這個領域最確定的事實就是,「假裝看不見」並不能帶來公平。

    書中也詳細討論新聞機構 ProPublica 對再犯風險評估工具 COMPAS 的調查:在犯罪紀錄相近的情況下,黑人被告得到的風險分數比白人高。這個工具號稱客觀,其實把歷史資料裡的種族偏見也一起編進去了。由於公平的定義彼此衝突,它可以在某種數學定義下「公平」,在另一種定義下卻明顯不公平,每一次部署,背後都藏著一個價值選擇。

    透明:黑盒子不是必然

    第三章談透明。作者介紹 word2vec 這類「詞向量」模型:它把字詞變成數字,能算出「國王-男人+女人=女王」這種關係,但也會算出「醫生-男人+女人=護士」,把社會既有的刻板印象一起學進去。

    另一方面,書中強調所謂的「黑盒子」並不是無法避免的。開發者可以想辦法呈現模型內部的節點在看什麼、為什麼給某些資料比較高的權重。一旦看得見,偏見才有機會被發現和修正。

    書中另一個著名例子來自研究者理查・卡魯阿納:一個預測肺炎死亡風險的模型,竟然學到「有氣喘的肺炎病人死亡風險比較低」。原因是氣喘病人在醫院會被更積極地治療,所以存活率較高。如果沒人看懂模型在想什麼就直接拿來用,它可能建議把氣喘病人送回家,非常危險。

    強化:從獎勵中學習

    第二部分轉向會自己行動的系統。作者從動物學習講起:動物透過獎勵與懲罰學會行為,強化學習也是讓機器在嘗試中依照獎勵訊號調整。

    差別在於,機器得到的回饋往往非常簡短、沒什麼建設性,而且來得很晚,例如一整盤棋下完才知道輸贏。作者認為真正的對齊問題就藏在這裡:重點不只是機器怎麼把獎勵最大化,而是人類該怎麼設計獎勵。

    作者也介紹神經科學家沃夫朗・舒茲對多巴胺的發現:大腦用「預期和實際結果之間的落差」來學習,這個概念和強化學習的演算法驚人地相似,讓電腦科學和神經科學互相印證。

    塑造與好奇心

    「塑造」一章借用行為心理學的概念:先獎勵接近目標的小步驟,再一步步引導到完整的行為。書中也談到怎麼處理回饋非常稀少的情況。

    「好奇心」一章介紹另一種思路:與其給機器明確的分數,不如讓它追求新奇和驚喜。書中提到,有些只被設定要「探索新東西」、完全不看遊戲分數的 AI,反而很會打電玩,因為死掉回到開頭畫面太無聊了,它自然會想辦法活下去、往沒去過的地方走。

    書中回顧心理學家史金納用鴿子做的實驗:只要一步一步獎勵越來越接近目標的動作,就能教會鴿子相當複雜的行為。電玩《蒙特祖瑪的復仇》則是反例:要完成一長串動作才拿得到分數,傳統強化學習幾乎完全卡關,直到研究者給 AI 加上「探索本身就是獎勵」的內在動機才有突破。

    模仿與推論

    第三部分討論機器如何學會人類想要什麼。「模仿」一章談讓機器觀察人類並照著做,就像小孩學大人一樣,作者也分析了這種方法的優點與限制。

    「推論」一章介紹逆向強化學習:不直接告訴機器目標是什麼,而是讓它觀察人的行為,反推出人想達成什麼。這在訓練機器人動作時特別有用,因為很多動作很難一條一條寫成明確的指令。

    書中提到史丹佛研究團隊用逆向強化學習,讓無人直升機觀察技術高超的飛行員,學會高難度的特技飛行,而不是把飛行動力學一條一條寫進程式。模仿學習也有陷阱:示範資料裡沒出現過的狀況,機器就不知道怎麼辦,因此有研究者提出讓專家針對機器犯錯的情境再補充示範的方法。

    不確定性與可修正性

    最後一章談不確定性。現實世界千變萬化,一個太有把握的模型,很容易在沒見過的情況下犯下嚴重錯誤。讓機器知道自己「不知道」,是讓它更安全的重要一步。

    作者也談到「可修正性」:當系統越來越強,它可能把人類的介入看成需要繞過的障礙。如何讓強大的系統仍然願意接受人類糾正,是對齊問題最根本的難題之一。

    各方評價

    AI 安全研究社群的書評者原本抱著懷疑的態度,以為這會是一本脫離技術現實的書,讀完後卻稱它「各方面都很出色」,認為它同時適合關心社會議題的人和想成為工程師的人閱讀。

    《富比士》的書評則認為,書中對強化學習和逆向強化學習的解說特別清楚,但花了太多篇幅在人類心理學上,和機器學習的連結有時不夠緊密。

    Shang的觀點

    敬請期待

    其他書摘連結

    • Book Review: The Alignment Problem(Alignment Forum)
    • The Alignment Problem, Linking Machine Learning and Human Values(Forbes)
    • The Alignment Problem(SoBrief)
    封面為原創示意設計,非出版社原版封面

    留下漂流瓶

    留下你的看法吧!有機會認識跟你想法相同的航海者喔!

    我想把這本書推薦給另一位航海者
    我的推薦指數 拖曳選擇 0.0 – 5.0 分
    4.0
    前往羅弗敦群島拜訪花楸

    登記成為航海者,才能打開漂流瓶。

    0 個漂流瓶

    ▇▇▇▇▇ ▇▇▇ ▇▇▇▇▇▇▇

    ▇▇▇▇ ▇▇▇▇▇▇ ▇▇▇

    Shang

    Shang

    Shang 的書單

    航海指南

    這個世界

    書海有 16 座真實的島嶼,每座島代表一個主題。島上的每個建築,都是一本書。

    現在可以做什麼

    • 在海圖上點一座島上岸
    • 點島上的建築,閱讀那本書的筆記
    • 到領航員那裡認識 Shang

    即將開放

    • 第二章:登記成為航海者、駕船航行、收集建築徽章、丟漂流瓶
    • 第三章:貝殼、港口市集、驅散迷霧、排行榜
    • 第四章:和其他航海者私下聊天

    圖示說明

    切換語言

    領航員登記處

    出航之前,我們要幫你登記船籍

    航海日誌

    信箱

    排行榜

    航海日誌

    審核漂流瓶

    Shang

    書海 Apsû

    回海圖
    APSÛ // COMM●