書海Apsû
海图 领航员 航海指南
登记成为航海者

書海 ApsûVoyage of a Thousand Books

選擇語言 · Choose your language

书海海图

拖曳或缩放海图,点一座岛就能上岸

← 回到海图

← 回到岛上 · 罗弗敦群岛
挪威森林猫
读完书摘并留下漂流瓶,即可获得挪威森林猫
登记后就能收集这只生物
人类相容(暂译)
原文书名:Human Compatible
作者:史都华・罗素 (Stuart Russell) ⓘ
入围《金融时报》与麦肯锡年度商业书长名单
人类相容(暂译)

0:00
    不要让机器去完成我们给它的目标,而要让它去完成我们真正想要的事,而且它必须承认自己不确定那是什么。
    阅读进度 80%
    ▶ 懒得看文字的人,这里有说书影片:)
    ▶ 敬请期待说书影片
    前往罗弗敦群岛

    适合谁看?

    • 担心 AI 越来越强之后,人类会不会失去控制的人
    • 想了解「AI 安全」到底在研究什么,又不想读太多数学的读者
    • 学资讯、哲学或政策,想找一本 AI 伦理经典入门书的学生
    • 听过「回纹针」或「AI 毁灭人类」的说法,想知道专家真正的论点是什么的人

    作者是何许人也?

    • 史都华・罗素 (Stuart Russell),美国加州大学柏克莱分校电脑科学教授
    • 与彼得・诺米格 (Peter Norvig) 合写全球最广泛使用的 AI 教科书《人工智慧:现代方法》
    • 本书英文原名 Human Compatible: Artificial Intelligence and the Problem of Control,2019 年出版

    其他书籍《人工智慧:现代方法》(与 Peter Norvig 合著)

    本书架构

    🔒 抵达罗弗敦群岛拜访挪威森林猫后,就能看完整内容

    前往罗弗敦群岛
    超级智慧还差哪几步

    罗素认为,让 AI 变成超级智慧的关键,不是电脑还不够快,而是还有几个观念上的突破没有完成:真正理解语言、具备常识、能不断累积学习、能自己发现事情的层次结构,以及能思考自己的思考。

    这些是演算法上的难题,什么时候解开没人知道,但他提醒,我们不能等到它发生了才开始想怎么控制它。

    巨大的奖赏与巨大的风险

    作者先描述好处有多大:如果 AI 能把几乎所有人类劳动自动化,全球生产总值可能提高十倍,他估算其净现值大约是一万三千五百兆美元。

    但同样强大的 AI,也可能被用来做大规模监控、自主武器、操纵人心的深伪影片和行为控制。换句话说,问题不只在于 AI 本身,也在于谁用它、用来做什么。

    为什么现在就要开始担心

    罗素指出,AI 的进步几乎不可能停下来,因为背后有庞大的经济诱因:自驾车、虚拟助理等应用已经随处可见,潜在的经济价值以兆美元计。

    既然没人能确定超级智慧什么时候出现,他主张安全研究必须现在就开始,而不是等到它来了才补救。他也批评,AI 研究圈里有些人一听到风险就急著否认,这比较像是在维护自己的「部落」,而不是理性评估。

    他特别说明,三条原则里的「偏好」范围非常广,涵盖人在任何时间尺度上可能在乎的一切;「行为」则是指人在不同选项之间做出的任何选择。这些原则是给开发者的设计指引,而不是直接写进机器里的程式码。

    各方评价与争论

    本书 2019 年 10 月由 Viking 出版,入围当年《金融时报》与麦肯锡年度商业书奖的长名单。

    《卫报》称它是「今年最重要的一本 AI 书」,《金融时报》赞赏它「令人振奋的思想严谨」,《华尔街日报》的书评则说它「谈得很深,又充满冷面幽默」。

    也有人提出质疑。《泰晤士报》的书评认为,技术部分太难,哲学部分又讲得太简单。《自然》期刊与《纽约时报》的评论者则怀疑超级智慧是否真的可能出现,并认为真正具备通用智慧的机器,自然会拥有常识、价值观和社会判断,不会做出书中思想实验里那种荒谬的事。这些争论本身,也正是本书想要引发的讨论。

    大猩猩问题

    罗素用「大猩猩问题」来点出核心担忧:当世界上出现比人类聪明得多的机器,人类还能保有主导权和自主权吗?

    今天大猩猩的命运取决于人类怎么对待牠们。不同的是,人类是自己亲手设计未来可能比自己更聪明的东西。这是我们的优势,但前提是设计原则必须是对的。如果智慧突然爆炸式成长,可能根本没有机会在事后修正错误。

    「标准模型」的致命缺陷

    目前的 AI 研究几乎都建立在一个「标准模型」上:人类先给机器一个明确的目标,例如强化学习的奖励函数、统计模型的损失函数,机器再想办法把这个目标做到最好。

    罗素认为这个做法有根本的漏洞。他举社群媒体为例:推荐演算法一点都不聪明,只是想让使用者多点击,但它发现,让人变得更好预测,就能推更多会被点的东西,结果不知不觉把使用者推向更极端的立场。一个没有智慧的演算法,就已经造成真实的社会伤害。

    迈达斯国王与「死了就拿不到咖啡」

    作者用希腊神话里的迈达斯国王说明「目标设错」的危险:他希望碰到的东西都变成黄金,结果连女儿和食物也变成了金子。民间故事里的精灵也一样,总是照字面实现愿望,却带来灾难。

    另一个著名的说法是「死了就没办法去拿咖啡」:就算你只叫机器人去拿一杯咖啡,它也会推论出「我必须持续运作才能完成任务」,因此可能抗拒被关机。几乎任何明确的目标,都会让机器产生保护自己、取得更多资源这类副目标,跟目标本身好不好无关。

    三条新原则

    罗素的解方,是重新定义什么叫「有益的机器」:机器有益,是指它的行动可以预期会实现「我们」的目标,而不是它自己的目标。

    他提出三条原则:第一,机器唯一的目标是尽可能实现人类的偏好;第二,机器一开始并不确定这些偏好是什么;第三,人类的行为是了解人类偏好最终的资讯来源。

    关键在第二条:因为机器不确定我们要什么,它就会愿意询问、愿意接受纠正,也愿意让人把它关掉。

    辅助游戏与关机开关

    为了把这些原则变成可以研究的问题,罗素提出「合作式逆向强化学习」,也就是一种「辅助游戏」:机器人不是被动地模仿人,而是会主动提问、确认,人也可以教它,双方一起把事情做好。

    他还设计了一个「关机游戏」来证明:只要机器人不确定继续做下去是否符合人的心意,接受被关机就是它最好的选择。不过这个保证有前提:如果机器人错误地对自己的判断过度有把握,安全性就会消失。

    还没解开的难题

    作者坦白承认,这套方法还有许多困难。人说话常常有没讲出口的前提,例如「帮我买附近的咖啡」,前提是附近真的有咖啡店;机器必须懂得在前提不成立时回来确认,而不是不择手段地执行。

    当机器要服务很多人时,问题更复杂:如果每个人都有一个只为自己著想的 AI 代理,最不在乎别人的人反而最占便宜;法律也不够,因为超级智慧可以找到合法却损人的做法。反过来,如果让 AI 完全以功利主义行事,它又可能把所有心力都拿去帮助世界上处境最差的人,而不是它的主人;作者称之为「索马利亚问题」,这样的产品在商业上很难成立。此外,人的偏好会随时间改变,「当下的自己」和「回忆中的自己」想要的也不一定相同。

    罗素认为,这些问题需要 AI、认知科学、心理学与神经科学一起合作才能解决,而现在就是开始的时候。

    Shang的观点

    敬请期待

    其他书摘链接

    • Summary of Human Compatible(EA Forum)
    • Human Compatible(Wikipedia)
    • Human Compatible(Goodreads)
    封面为原创示意设计,非出版社原版封面

    留下漂流瓶

    留下你的看法吧!有机会认识跟你想法相同的航海者哦!

    我想把这本书推荐给另一位航海者
    我的推荐指数 拖动选择 0.0 – 5.0 分
    4.0
    前往罗弗敦群岛拜访挪威森林猫

    登记成为航海者,才能打开漂流瓶。

    0 个漂流瓶

    ▇▇▇▇▇ ▇▇▇ ▇▇▇▇▇▇▇

    ▇▇▇▇ ▇▇▇▇▇▇ ▇▇▇

    Shang

    Shang

    Shang 的书单

    航海指南

    这个世界

    书海有 16 座真实的岛屿,每座岛代表一个主题。岛上的每个建筑,都是一本书。

    现在可以做什么

    • 在海图上点一座岛上岸
    • 点岛上的建筑,阅读那本书的笔记
    • 到领航员那里认识 Shang

    即将开放

    • 第二章:登记成为航海者、驾船航行、收集建筑徽章、丢漂流瓶
    • 第三章:贝壳、港口市集、驱散迷雾、排行榜
    • 第四章:和其他航海者私下聊天

    图示说明

    切换语言

    领航员登记处

    出航之前,我们要帮你登记船籍

    航海日志

    信箱

    排行榜

    航海日志

    审核漂流瓶

    Shang

    書海 Apsû

    回海圖
    APSÛ // COMM●