選擇語言 · Choose your language
拖曳或缩放海图,点一座岛就能上岸


其他书籍《决断的演算》(Algorithms to Live By,与 Tom Griffiths 合著);The Most Human Human
🔒 抵达罗弗敦群岛拜访花楸后,就能看完整内容
前往罗弗敦群岛本书分成三大部分,每部分三章,从基础一路走到进阶。
第一部分「预言」谈机器学习的预测系统,包含「表征」、「公平」与「透明」三章;第二部分「能动性」谈会自己行动的系统,包含「强化」、「塑造」与「好奇心」;第三部分「规范」谈机器如何学会人类想要什么,包含「模仿」、「推论」与「不确定性」。
克里斯汀用大量研究者的访谈与真实案例,把技术问题和人类心理学、行为科学串在一起,让没有技术背景的读者也能看懂。
第一章从一个知名事件开始:2015 年,Google 相簿的图片分类器把黑人标记成「大猩猩」。原因是训练资料里的人脸样本不够多元。
书中提到,Google 后来的处理方式不是补足多元的训练资料,而是直接把这个标签关掉。作者借此说明,许多图片资料库长期以白人、男性为主,神经网路自然在其他族群身上表现较差。资料里没有谁,模型就看不见谁。
第二章讨论演算法公平。作者以刑事司法系统用来预测再犯风险、协助假释判断的工具为例,指出如果拿一个本来就有问题的制度产生的资料去训练机器,机器只会把问题延续下去。
更棘手的是,公平有好几种定义,而且在数学上无法同时满足。如果完全忽略种族,结果可能对黑人不利;如果把种族纳入考量来追求结果平等,又可能对其他群体不公平。书中引用研究者莫里兹・哈特的话:这个领域最确定的事实就是,「假装看不见」并不能带来公平。
书中也详细讨论新闻机构 ProPublica 对再犯风险评估工具 COMPAS 的调查:在犯罪纪录相近的情况下,黑人被告得到的风险分数比白人高。这个工具号称客观,其实把历史资料里的种族偏见也一起编进去了。由于公平的定义彼此冲突,它可以在某种数学定义下「公平」,在另一种定义下却明显不公平,每一次部署,背后都藏著一个价值选择。
第三章谈透明。作者介绍 word2vec 这类「词向量」模型:它把字词变成数字,能算出「国王-男人+女人=女王」这种关系,但也会算出「医生-男人+女人=护士」,把社会既有的刻板印象一起学进去。
另一方面,书中强调所谓的「黑盒子」并不是无法避免的。开发者可以想办法呈现模型内部的节点在看什么、为什么给某些资料比较高的权重。一旦看得见,偏见才有机会被发现和修正。
书中另一个著名例子来自研究者理查・卡鲁阿纳:一个预测肺炎死亡风险的模型,竟然学到「有气喘的肺炎病人死亡风险比较低」。原因是气喘病人在医院会被更积极地治疗,所以存活率较高。如果没人看懂模型在想什么就直接拿来用,它可能建议把气喘病人送回家,非常危险。
第二部分转向会自己行动的系统。作者从动物学习讲起:动物透过奖励与惩罚学会行为,强化学习也是让机器在尝试中依照奖励讯号调整。
差别在于,机器得到的回馈往往非常简短、没什么建设性,而且来得很晚,例如一整盘棋下完才知道输赢。作者认为真正的对齐问题就藏在这里:重点不只是机器怎么把奖励最大化,而是人类该怎么设计奖励。
作者也介绍神经科学家沃夫朗・舒兹对多巴胺的发现:大脑用「预期和实际结果之间的落差」来学习,这个概念和强化学习的演算法惊人地相似,让电脑科学和神经科学互相印证。
「塑造」一章借用行为心理学的概念:先奖励接近目标的小步骤,再一步步引导到完整的行为。书中也谈到怎么处理回馈非常稀少的情况。
「好奇心」一章介绍另一种思路:与其给机器明确的分数,不如让它追求新奇和惊喜。书中提到,有些只被设定要「探索新东西」、完全不看游戏分数的 AI,反而很会打电玩,因为死掉回到开头画面太无聊了,它自然会想办法活下去、往没去过的地方走。
书中回顾心理学家史金纳用鸽子做的实验:只要一步一步奖励越来越接近目标的动作,就能教会鸽子相当复杂的行为。电玩《蒙特祖玛的复仇》则是反例:要完成一长串动作才拿得到分数,传统强化学习几乎完全卡关,直到研究者给 AI 加上「探索本身就是奖励」的内在动机才有突破。
第三部分讨论机器如何学会人类想要什么。「模仿」一章谈让机器观察人类并照著做,就像小孩学大人一样,作者也分析了这种方法的优点与限制。
「推论」一章介绍逆向强化学习:不直接告诉机器目标是什么,而是让它观察人的行为,反推出人想达成什么。这在训练机器人动作时特别有用,因为很多动作很难一条一条写成明确的指令。
书中提到史丹佛研究团队用逆向强化学习,让无人直升机观察技术高超的飞行员,学会高难度的特技飞行,而不是把飞行动力学一条一条写进程式。模仿学习也有陷阱:示范资料里没出现过的状况,机器就不知道怎么办,因此有研究者提出让专家针对机器犯错的情境再补充示范的方法。
最后一章谈不确定性。现实世界千变万化,一个太有把握的模型,很容易在没见过的情况下犯下严重错误。让机器知道自己「不知道」,是让它更安全的重要一步。
作者也谈到「可修正性」:当系统越来越强,它可能把人类的介入看成需要绕过的障碍。如何让强大的系统仍然愿意接受人类纠正,是对齐问题最根本的难题之一。
AI 安全研究社群的书评者原本抱著怀疑的态度,以为这会是一本脱离技术现实的书,读完后却称它「各方面都很出色」,认为它同时适合关心社会议题的人和想成为工程师的人阅读。
《富比士》的书评则认为,书中对强化学习和逆向强化学习的解说特别清楚,但花了太多篇幅在人类心理学上,和机器学习的连结有时不够紧密。
留下你的看法吧!有机会认识跟你想法相同的航海者哦!
书海有 16 座真实的岛屿,每座岛代表一个主题。岛上的每个建筑,都是一本书。
出航之前,我们要帮你登记船籍