書海Apsû
海图 领航员 航海指南
登记成为航海者

書海 ApsûVoyage of a Thousand Books

選擇語言 · Choose your language

书海海图

拖曳或缩放海图,点一座岛就能上岸

← 回到海图

← 回到岛上 · 罗弗敦群岛
花楸
读完书摘并留下漂流瓶,即可获得花楸
登记后就能收集这只生物
对齐问题(暂译)
原文书名:The Alignment Problem
作者:布莱恩・克里斯汀 (Brian Christian) ⓘ
对齐问题(暂译)

0:00
    我们该问的不只是「机器如何把奖励最大化」,而是「我们该怎么设计奖励,才能让它做出我们真正想要的事」。
    阅读进度 80%
    ▶ 懒得看文字的人,这里有说书影片:)
    ▶ 敬请期待说书影片
    前往罗弗敦群岛

    适合谁看?

    • 想知道 AI 为什么会学到偏见、又该怎么修正的人
    • 对演算法公平、AI 透明度等社会议题有兴趣的读者
    • 学资讯、心理学或社会科学,想看两个领域怎么交会的学生
    • 想用故事而不是公式理解机器学习的人

    作者是何许人也?

    • 布莱恩・克里斯汀 (Brian Christian),美国作家,擅长把电脑科学与哲学、心理学写给一般读者
    • 曾与认知科学家汤姆・葛瑞菲斯合著《决断的演算》
    • 本书英文原名 The Alignment Problem: Machine Learning and Human Values,2020 年出版

    其他书籍《决断的演算》(Algorithms to Live By,与 Tom Griffiths 合著);The Most Human Human

    本书架构

    🔒 抵达罗弗敦群岛拜访花楸后,就能看完整内容

    前往罗弗敦群岛
    全书架构:预言、能动性、规范

    本书分成三大部分,每部分三章,从基础一路走到进阶。

    第一部分「预言」谈机器学习的预测系统,包含「表征」、「公平」与「透明」三章;第二部分「能动性」谈会自己行动的系统,包含「强化」、「塑造」与「好奇心」;第三部分「规范」谈机器如何学会人类想要什么,包含「模仿」、「推论」与「不确定性」。

    克里斯汀用大量研究者的访谈与真实案例,把技术问题和人类心理学、行为科学串在一起,让没有技术背景的读者也能看懂。

    表征:资料里缺了谁

    第一章从一个知名事件开始:2015 年,Google 相簿的图片分类器把黑人标记成「大猩猩」。原因是训练资料里的人脸样本不够多元。

    书中提到,Google 后来的处理方式不是补足多元的训练资料,而是直接把这个标签关掉。作者借此说明,许多图片资料库长期以白人、男性为主,神经网路自然在其他族群身上表现较差。资料里没有谁,模型就看不见谁。

    公平:数学上不可能两全

    第二章讨论演算法公平。作者以刑事司法系统用来预测再犯风险、协助假释判断的工具为例,指出如果拿一个本来就有问题的制度产生的资料去训练机器,机器只会把问题延续下去。

    更棘手的是,公平有好几种定义,而且在数学上无法同时满足。如果完全忽略种族,结果可能对黑人不利;如果把种族纳入考量来追求结果平等,又可能对其他群体不公平。书中引用研究者莫里兹・哈特的话:这个领域最确定的事实就是,「假装看不见」并不能带来公平。

    书中也详细讨论新闻机构 ProPublica 对再犯风险评估工具 COMPAS 的调查:在犯罪纪录相近的情况下,黑人被告得到的风险分数比白人高。这个工具号称客观,其实把历史资料里的种族偏见也一起编进去了。由于公平的定义彼此冲突,它可以在某种数学定义下「公平」,在另一种定义下却明显不公平,每一次部署,背后都藏著一个价值选择。

    透明:黑盒子不是必然

    第三章谈透明。作者介绍 word2vec 这类「词向量」模型:它把字词变成数字,能算出「国王-男人+女人=女王」这种关系,但也会算出「医生-男人+女人=护士」,把社会既有的刻板印象一起学进去。

    另一方面,书中强调所谓的「黑盒子」并不是无法避免的。开发者可以想办法呈现模型内部的节点在看什么、为什么给某些资料比较高的权重。一旦看得见,偏见才有机会被发现和修正。

    书中另一个著名例子来自研究者理查・卡鲁阿纳:一个预测肺炎死亡风险的模型,竟然学到「有气喘的肺炎病人死亡风险比较低」。原因是气喘病人在医院会被更积极地治疗,所以存活率较高。如果没人看懂模型在想什么就直接拿来用,它可能建议把气喘病人送回家,非常危险。

    强化:从奖励中学习

    第二部分转向会自己行动的系统。作者从动物学习讲起:动物透过奖励与惩罚学会行为,强化学习也是让机器在尝试中依照奖励讯号调整。

    差别在于,机器得到的回馈往往非常简短、没什么建设性,而且来得很晚,例如一整盘棋下完才知道输赢。作者认为真正的对齐问题就藏在这里:重点不只是机器怎么把奖励最大化,而是人类该怎么设计奖励。

    作者也介绍神经科学家沃夫朗・舒兹对多巴胺的发现:大脑用「预期和实际结果之间的落差」来学习,这个概念和强化学习的演算法惊人地相似,让电脑科学和神经科学互相印证。

    塑造与好奇心

    「塑造」一章借用行为心理学的概念:先奖励接近目标的小步骤,再一步步引导到完整的行为。书中也谈到怎么处理回馈非常稀少的情况。

    「好奇心」一章介绍另一种思路:与其给机器明确的分数,不如让它追求新奇和惊喜。书中提到,有些只被设定要「探索新东西」、完全不看游戏分数的 AI,反而很会打电玩,因为死掉回到开头画面太无聊了,它自然会想办法活下去、往没去过的地方走。

    书中回顾心理学家史金纳用鸽子做的实验:只要一步一步奖励越来越接近目标的动作,就能教会鸽子相当复杂的行为。电玩《蒙特祖玛的复仇》则是反例:要完成一长串动作才拿得到分数,传统强化学习几乎完全卡关,直到研究者给 AI 加上「探索本身就是奖励」的内在动机才有突破。

    模仿与推论

    第三部分讨论机器如何学会人类想要什么。「模仿」一章谈让机器观察人类并照著做,就像小孩学大人一样,作者也分析了这种方法的优点与限制。

    「推论」一章介绍逆向强化学习:不直接告诉机器目标是什么,而是让它观察人的行为,反推出人想达成什么。这在训练机器人动作时特别有用,因为很多动作很难一条一条写成明确的指令。

    书中提到史丹佛研究团队用逆向强化学习,让无人直升机观察技术高超的飞行员,学会高难度的特技飞行,而不是把飞行动力学一条一条写进程式。模仿学习也有陷阱:示范资料里没出现过的状况,机器就不知道怎么办,因此有研究者提出让专家针对机器犯错的情境再补充示范的方法。

    不确定性与可修正性

    最后一章谈不确定性。现实世界千变万化,一个太有把握的模型,很容易在没见过的情况下犯下严重错误。让机器知道自己「不知道」,是让它更安全的重要一步。

    作者也谈到「可修正性」:当系统越来越强,它可能把人类的介入看成需要绕过的障碍。如何让强大的系统仍然愿意接受人类纠正,是对齐问题最根本的难题之一。

    各方评价

    AI 安全研究社群的书评者原本抱著怀疑的态度,以为这会是一本脱离技术现实的书,读完后却称它「各方面都很出色」,认为它同时适合关心社会议题的人和想成为工程师的人阅读。

    《富比士》的书评则认为,书中对强化学习和逆向强化学习的解说特别清楚,但花了太多篇幅在人类心理学上,和机器学习的连结有时不够紧密。

    Shang的观点

    敬请期待

    其他书摘链接

    • Book Review: The Alignment Problem(Alignment Forum)
    • The Alignment Problem, Linking Machine Learning and Human Values(Forbes)
    • The Alignment Problem(SoBrief)
    封面为原创示意设计,非出版社原版封面

    留下漂流瓶

    留下你的看法吧!有机会认识跟你想法相同的航海者哦!

    …
    Shang

    Shang

    Shang 的书单

    航海指南

    这个世界

    书海有 16 座真实的岛屿,每座岛代表一个主题。岛上的每个建筑,都是一本书。

    现在可以做什么

    • 在海图上点一座岛上岸
    • 点岛上的建筑,阅读那本书的笔记
    • 到领航员那里认识 Shang

    即将开放

    • 第二章:登记成为航海者、驾船航行、收集建筑徽章、丢漂流瓶
    • 第三章:贝壳、港口市集、驱散迷雾、排行榜
    • 第四章:和其他航海者私下聊天

    图示说明

    切换语言

    领航员登记处

    出航之前,我们要帮你登记船籍

    航海日志

    信箱

    排行榜

    航海日志

    审核漂流瓶

    Shang

    書海 Apsû

    回海圖
    APSÛ // COMM●