書海Apsû
海图 领航员 航海指南
登记成为航海者

書海 ApsûVoyage of a Thousand Books

選擇語言 · Choose your language

书海海图

拖曳或缩放海图,点一座岛就能上岸

← 回到海图

← 回到岛上 · 格陵兰
格陵兰雪橇犬
读完书摘并留下漂流瓶,即可获得格陵兰雪橇犬
登记后就能收集这只生物
商业资料科学(暂译)
原文书名:Data Science for Business
作者:佛斯特・普洛沃斯特 (Foster Provost)、汤姆・佛西特 (Tom Fawcett) ⓘ
商业资料科学(暂译)

0:00
    更好的资料加上更好的资料科学家,等于更好的模型、更好的决策,以及可以持续的竞争优势。
    阅读进度 80%
    ▶ 懒得看文字的人,这里有说书影片:)
    ▶ 敬请期待说书影片
    前往格陵兰

    适合谁看?

    • 要和资料科学团队合作的主管、产品经理与行销人员
    • 商学院学生,想理解资料科学能为企业做什么
    • 刚入门的资料分析师,想建立扎实的观念架构
    • 想知道「模型好不好」该怎么判断的人

    作者是何许人也?

    • 佛斯特・普洛沃斯特 (Foster Provost),纽约大学商学院教授,长期研究资料科学与机器学习的商业应用
    • 汤姆・佛西特 (Tom Fawcett),资深资料科学家,在业界与研究界都有丰富经验
    • 英文原名 Data Science for Business: What You Need to Know about Data Mining and Data-Analytic Thinking,2013 年出版,被许多商学院采用为教科书

    本书架构

    🔒 抵达格陵兰拜访格陵兰雪橇犬后,就能看完整内容

    前往格陵兰
    资料分析思维

    本书的核心概念是「资料分析思维」:用资料的角度看待商业问题,有系统地拆解问题,而不是只凭直觉。作者认为,在现代经济中,资料是一种策略资产,懂得善用它的公司,就能建立竞争优势。

    这本书不是写给工程师看的程式手册,而是要让主管和商业人士理解资料科学的基本原理。作者强调,经理人不需要会写程式,但必须懂得这些原则,才能和技术团队有效合作、提出对的问题。

    它要培养的,是一种提问与判断的能力。

    飓风来袭前的草莓派

    书中一开始就举了一个著名的例子。2004 年飓风法兰西丝来袭前,沃尔玛分析过去飓风期间的销售数据,发现了意想不到的模式:除了手电筒之外,草莓口味的吐司塔销量大约会暴增到平常的七倍。

    这种发现没有明显的因果解释,却能可靠地预测需求,让沃尔玛提前把正确的商品送到正确的店。作者用这个例子说明,资料探勘能找出人想不到、却真实存在的消费行为模式。

    席格内银行的故事:把亏损当成买资料

    书中另一个深具启发的例子,是 1990 年代美国席格内银行(Signet Bank)在信用卡业务上的转型。银行发现,一小群客户贡献了超过百分之百的利润,其他客户不是打平就是亏钱。

    于是银行刻意对不同客户随机提供不同的条件,接受短期的亏损,把它当成「取得资料的成本」。几年下来,这些实验累积的资料让银行建立了预测模型,能针对不同客户提供量身订做的方案,获利大幅提升。这说明资料本身就是值得投资的资产。

    九种资料探勘任务

    作者把各式各样的资料问题,归纳成几种基本任务:分类、回归、相似度比对、分群、共同出现的分组(例如购物篮分析)、轮廓描述、连结预测、资料缩减,以及因果模型。

    他们认为,把一个商业问题正确地转化成其中一种资料科学问题,往往比演算法本身更重要。正如书中所说,分析师富有创意的问题设定,常常就是成功的一半。

    问对问题,才能找对方法。

    MegaTelCo:谁会流失

    全书反复使用一个虚构的电信公司 MegaTelCo 作为案例:在所有客户中,哪些人可能在合约到期后离开?公司应该对谁提供挽留方案?

    这个例子贯穿了许多章节,让读者看到同一个商业问题,如何一步步被定义成分类问题、选择特征、建立模型、评估效果,最后转化成实际的行销决策。

    作者也提醒,要及早让开发团队参与,而不是把资料科学当成和实际上线无关的另一件事;并要用心设计特征,而不是天真地把所有能拿到的变数都丢进模型里。

    CRISP-DM:资料探勘的流程

    书中介绍业界常用的资料探勘标准流程(CRISP-DM),分成六个阶段:理解商业问题、理解资料、准备资料、建立模型、评估模型,以及部署上线。

    作者强调,这个流程是反复循环的,而不是一条直线。评估之后常常需要回到前面,重新理解问题或重新准备资料。结构化的流程能降低探索性工作中的不确定性。

    监督式与非监督式学习

    作者提醒,分析一开始就要决定问题属于哪一种:如果有明确想要预测的目标,例如客户会不会流失,就是「监督式」学习;如果没有预设答案,而是想从资料中找出模式,例如替客户分群,就是「非监督式」学习。

    这个选择会决定能用哪些技术,以及需要投入多少资源去标记资料。书中也介绍相似度、最近邻居法和分群等非监督式方法。

    决策树与资讯增益

    在建立预测模型时,作者用决策树来说明基本原理。关键的概念是「资讯增益」:衡量某个属性能让我们对目标的不确定性减少多少,借此有系统地挑选最有用的属性。

    作者也说明,从简单的相关性出发,可以逐步建立更复杂的模型,但必须记得相关不等于因果。商业资料科学常常著重于准确的预测,不一定需要解释背后的机制,这和重视因果推论的计量经济学不同。

    过度拟合:最普遍的威胁

    作者把「过度拟合」视为所有资料科学工作中最普遍的威胁。一个把训练资料配得完美无缺的模型,往往只是记住了杂讯,而不是学到能套用在新资料上的规律。

    解决的方法包括:保留一部分资料不拿来训练,用来检验模型;交叉验证;以及控制模型的复杂度,例如修剪决策树或使用正则化。书中也提醒「资料泄漏」的陷阱:模型用到了在实际做决策时根本拿不到的变数。

    期望值框架:什么才是好模型

    全书最实用的工具之一,是「期望值框架」。作者认为,只看准确率是不够的:一个准确率百分之九十九的诈欺侦测系统,如果误报太多、让员工忙不过来,在经济上可能还是失败的。

    期望值框架要求把正确判断、错误判断的成本和效益都算进来,计算每个决策的预期获利。什么是好模型,完全取决于商业脉络。书中也介绍 ROC 曲线、获利曲线和提升图,让不懂技术的决策者也能看懂模型的表现。

    文字探勘与更多技术

    书中也示范如何把非结构化的文字转换成可分析的资料,例如「词袋」、词频加权等方法,应用在像是用新闻预测股价变动这类问题上。

    作者也介绍推荐系统、时间序列、因果推论与异常侦测等其他技术,提醒资料科学家要熟悉多种方法,而不是只会一种。

    资料是策略资产

    最后,作者把资料科学提升到公司策略的层次。他们举例,零售商能从购买模式预测顾客是否怀孕,取得行销上的优势;社群网站的估值,也反映了它独特的网路资料。

    作者主张,资料科学要成功,需要经理人理解基本原理、商业和技术团队跨部门合作、长期投资资料资产,并重视隐私等伦理问题。资料科学不是一个孤立的技术部门,而是需要人才、流程和资料品质共同支撑的策略能力。

    Shang的观点

    敬请期待

    其他书摘链接

    • Data Science for Business Summary(Bookey)
    • Notes on Data Science for Business(daaronr)
    • Data Science for Business(Ben Munoz)
    封面为原创示意设计,非出版社原版封面

    留下漂流瓶

    留下你的看法吧!有机会认识跟你想法相同的航海者哦!

    …
    Shang

    Shang

    Shang 的书单

    航海指南

    这个世界

    书海有 16 座真实的岛屿,每座岛代表一个主题。岛上的每个建筑,都是一本书。

    现在可以做什么

    • 在海图上点一座岛上岸
    • 点岛上的建筑,阅读那本书的笔记
    • 到领航员那里认识 Shang

    即将开放

    • 第二章:登记成为航海者、驾船航行、收集建筑徽章、丢漂流瓶
    • 第三章:贝壳、港口市集、驱散迷雾、排行榜
    • 第四章:和其他航海者私下聊天

    图示说明

    切换语言

    领航员登记处

    出航之前,我们要帮你登记船籍

    航海日志

    信箱

    排行榜

    航海日志

    审核漂流瓶

    Shang

    書海 Apsû

    回海圖
    APSÛ // COMM●